取材の音声を原稿にするまで、いちばん時間を食うのはどこか
文字起こしが終わってからが本番です。引用の裏取り、話者の取り違え、逐語と整文の切り替え。ライター・編集者の実作業に沿って、どこで時間が消えるかと減らし方をまとめました。

取材が1時間。文字起こしが終わって、ようやく原稿にとりかかる——と思ったら、そこから半日消えている。
時間を食っているのは「起こす」工程ではありません。AIで下書きが数分でできるようになった今、残っているのは別のところです。
工程ごとに、どこへ時間が消えるか
1時間の取材を記事にするまでを分解します。
| 工程 | 手作業だけ | AIで下書きを作る場合 |
|---|---|---|
| 文字起こし | 3〜5時間 | 数分 |
| 誤変換・固有名詞の修正 | (上に含む) | 20〜40分 |
| 引用の裏取り | 30分〜 | 30分〜(減らない) |
| 逐語 → 整文 | 1〜2時間 | 40分〜1時間 |
| 構成・執筆 | 2時間〜 | 2時間〜(減らない) |
減るのは1行目だけです。ここが劇的に減ったので、相対的に2行目と3行目が目立つようになったというのが実情だと思います。
いちばん危ないのは、引用の裏取り
記事に「」で括って載せる一文は、言っていないことを言ったことにできない唯一の場所です。AIの文字起こしは、聞き取りにくい箇所をそれらしい言葉で埋めます。空欄を残すより、文脈に合う語を入れる方に傾く。だからいちばん自然に読める箇所ほど、確認する価値があります。実際に起きる崩れ方は3つです。
- 固有名詞が別の語に化ける。社名・製品名・人名は、AIが知らなければ音の近い一般語になります
- 否定が消える。「やらないわけではない」が「やらない」になる。文としては自然なので気づけません
- 話者が入れ替わる。相槌の多い取材で起きます。聞き手の言葉が話し手の発言として記録される
3つ目が取材ではとくに厄介です。2人しかいない取材でも起きます。「はい」「なるほど」「そうですね」が続いたあと、話し手の発言に聞き手の一言が混ざる。それを引用に使うと、取材相手が言っていないことを本人の発言として載せることになります。
裏取りを2〜3分で終わらせる
「全部聞き直せば確実」——そのとおりですが、それだと1時間かかります。文字起こしを使う意味がなくなる。必要なのは、引用に使う段落だけ、その瞬間の音声に飛べることです。
1時間の取材で、実際に「」で括る箇所はふつう3〜5か所。1か所30秒で確認できるなら、全部で2〜3分です。これなら成立します。
そのためには、文字起こしの各行に音声の時刻が紐づいている必要があります。紐づいていないテキストは、疑わしい箇所を見つけても確かめる手段がありません。確かめられないものは、結局そのまま載せることになります。
道具を選ぶときに見るべきはここだと思います。精度の数字より、間違っていたときに気づけるか。
逐語録と整文は、先に確認する
発注の形式によって作業量が変わります。
| 何を残すか | 求められる場面 | |
|---|---|---|
| 逐語録 | 言い淀み・フィラー・重複も全部 | 研究・学術、裁判関連、資格試験の記録 |
| 整文 | 読める文章に整える | 記事化が前提の取材、社内共有 |
| 要約 | 要点のみ | 議事録、報告 |
逐語録は「整えない」ことが仕事なので、AIの出力をそのまま使うと逆に手が増えることがあります。AIは読みやすく整える方に寄るので、消えたフィラーを戻す作業が発生する。逐語録が要るなら、整文しない設定があるかを先に確認してください。
キャリアコンサルタントの資格試験や、質的研究のインタビュー分析では逐語録が前提です。ここを取り違えると、納品後に全部やり直しになります。
録り方で、あとの作業がだいぶ変わる
文字起こしの精度は、機材より置き方で決まります。
- 話し手の正面に置く。取材は聞き手と話し手の距離が近いので、真ん中ではなく話し手寄りに
- 机に直置きしない。ノートを1枚挟むだけでペン音と机の振動が減ります
- カフェ取材は覚悟する。BGMと食器の音は、人の耳では気にならなくても認識には効きます。可能なら壁際の席、スピーカーから遠い側
- ICレコーダーとスマホの二重録り。取材は録り直しがききません。片方が失敗しても残るようにしておく価値があります
逆に効果が薄いのは、高いマイクを足すことと、音質設定を上げることです。誤変換の多くは音の問題ではなく「その単語を知らない」ことが原因なので、固有名詞を事前に登録できる道具の方が効きます。
名前を先に教えておく
取材前に分かっている固有名詞——取材相手の氏名、所属、製品名、業界用語——を先に登録しておける道具があります。文字起こしのときにその語を候補として渡すので、誤変換が目に見えて減ります。ただし取材は、事前に全部は分からない。話の中で初めて出る社名や人名は登録できません。だから「事前登録」だけに頼る設計だと、取材では取りこぼします。
あとから直せるかも同じくらい大事です。「サクラ商事を全部サクラ物産に」のような一括置換が効くと、20〜40分の修正工程がかなり縮みます。
Recoryの場合
Recoryは取材にそのまま使えます。この記事の内容に対応する部分です。
- 文字起こしと議事録の一行ごとに [mm:ss] が付き、触れるとその瞬間の音声が鳴ります。引用の裏取りが1か所30秒で終わります
- 話者分離あり。まとまってしまったら、聞き分けに強い別のモデルで起こし直せます(有料プラン)
- 単語帳に固有名詞を登録すると、次回から文字起こしに反映されます
- 表記の一括修正と、話し言葉でのAI修正依頼(「3つ目の引用、否定が抜けています」で通ります)
- SRT(字幕)で書き出せます。動画コンテンツにするときそのまま使えます。Markdown / テキスト / RTF(Wordで開ける)も
- 最長4時間の連続録音。長い取材でも切れません
できないことも書きます。電話・オンライン通話の録音はできません。iPhoneの標準の通話録音は「電話」アプリの機能で、Recoryはその外側にいます。Zoom取材なら、Zoom側で録画したファイルを取り込む形になります。また完全な逐語録の書式には最適化していません——議事録として読める形に整える方向の道具なので、フィラーまで残す納品が必要なら別の手段と併用してください。
音声ファイルをテキストに起こす段の手順は音声から文字起こしする方法にまとめました。形式と長さで詰まりどころが変わるので、原稿にする前にそちらを見てください。
文字起こしの3つのやり方と、かかる時間は文字起こしとはに並べました。取材では素起こしを残す意味があります。あとから発言を確認する必要が出たとき、整文したものだけでは戻れません。
取材の文字起こしで削れる時間は、もうほとんど削れています。残っているのは、確かめる時間と、整える時間です。前者を2〜3分に圧縮できるかどうかが、いまの道具選びの分かれ目だと思います。
よくある質問
取材の文字起こしは1時間あたりどのくらいかかりますか
手作業なら3〜5時間が相場です。AIで下書きを作ると、そこから読んで直す作業になり1時間前後まで縮みます。ただし縮むのは「起こす」工程だけで、引用の確認と整文の時間は残ります。
逐語録と整文はどちらで納品すべきですか
発注時に確認してください。逐語録は言い淀みやフィラーも残す形式で、研究・学術・裁判関連で求められます。整文は読める文章に整えたもので、記事化が前提の取材で使われます。両方求められる場合は、逐語録を保管しつつ整文を納品する形になります。
話者が2人でも取り違えは起きますか
起きます。とくに相槌が多い取材では、聞き手の「はい」「なるほど」が話し手の発言に混ざりやすい。引用として使う段落は、公開前に必ず音声で確認してください。
iPhoneのボイスメモで文字起こしすると、誰の発言か分からなくなる理由
AIが書いた議事録は、どこまで信じていいか