Recory ノート ダウンロード
iPhoneで会議を録る

手元の音声ファイルを文字起こしする——形式別に通る道・通らない道

mp3、m4a、wav、そして会議の録画。もらった音声ファイルをテキストにしたいとき、どの形式が素通りで、どこで変換が要るのか。iPhone1台で完結する道順を先に、詰まる場所を正直に書きます。

「この録音、文字にしておいて」とファイルだけ渡されることがあります。自分で録った音声なら録ったアプリの中で完結しますが、手元に来たファイルはそうはいきません。

この記事の内容(19項目)
  1. 形式の早見表
  2. 「通る形式」はサービスごとに違う
  3. iPhone 1台で完結する道順
  4. iPhoneだけでどこまでできるか
  5. 会議の録画(mp4)の場合
  6. どこから来たファイルかで、見るところが変わる
  7. Windowsで下準備する
  8. Macで下準備する
  9. m4aで詰まるとき
  10. mp3に変換したほうがよいのか
  11. mp4(動画)をそのまま渡してよいか
  12. Wordのトランスクリプトで起こす
  13. ファイルが大きくて弾かれるとき
  14. 文字起こしの前に音を整える
  15. 長い音声を分けると、何が壊れるか
  16. 詰まったときの見分け方
  17. うまくいかないとき、公式に原因が書いてあるもの
  18. 無料でやるか、道具に載せるか
  19. 人から預かった音声を、外のサービスに渡す前に

結論から言うと、大半の形式はそのまま通ります。詰まる場所は決まっているので、先に全体の地図を置きます。

形式を確かめる端末へ入れる文字起こしへ渡す
手元の音声ファイルを文字にするまで。形式で通る道が変わる。

形式の早見表

形式正体そのまま通るか
mp3いちばん普及した圧縮音声通る(事実上どこでも)
m4aiPhoneの標準(ボイスメモもこれ)通る(ほぼどこでも)
wav無圧縮。ICレコーダーの高音質設定通る(ファイルが大きいのが難点)
mp4 / mov動画。会議の録画など多くで通る(音声部分だけ処理される)
WMAWindows系の古い圧縮音声通らないことが多い。変換が要る
.dvf / .msv など古いソニー機などの独自形式通らない。変換が要る

迷ったらmp3にしておけば間違いありません。そして、いま手元にあるのがmp3・m4a・wav・mp4なら、変換は要りません。そのまま次へ進めます。

「通る形式」はサービスごとに違う

上の早見表は「たいていのサービスなら」の話です。実際に受け付ける形式は、サービスごとにまったく違います。ここを知らないまま作業すると、わざわざmp3に変換したのに弾かれる、逆にm4aのままで素通りした、という食い違いが起きます。

いちばん狭いのはWordのトランスクリプト機能です。Microsoftの公式ヘルプは「トランスクリプトは現在、.wav、.mp4、.m4a、.mp3 形式をサポートしています」と書いていて、挙げているのはこの4つだけです。aac・flac・wma・movは一覧に入っていません。

サービス公式に挙げられている形式
Word のトランスクリプト.wav / .mp4 / .m4a / .mp3 の4つ
Stream のトランスクリプトmp4・mov・wmv・mkv・avi などの動画コンテナと ogg
NotebookLMaac・m4a・mp3・mp4・ogg・opus・wav・wma など
Clipchamp(音声)mp3・wav・Ogg(変換を待たずに扱える形式)

Streamの一覧には、mp3もwavもm4aも入っていません。公式が列挙しているのは動画コンテナとoggだけです。音声だけのファイルをこの経路に通したいなら、いったん動画コンテナに入れる必要があります。

逆にNotebookLM(公式ヘルプの表記はGemini Notebook)は広く、aac・opus・wmaまで挙げています。ただしこの一覧は「など」で終わる例示で、網羅ではありません。一覧に無い形式が「非対応と明記されている」わけでもないので、通る/通らないをこの一覧だけで断定しないでください。

ひとつ具体例を挙げます。NotebookLMの音声形式の一覧に、flacは1度も出てきません。一方でAppleの技術仕様は、iPhoneのオーディオ再生が対応するフォーマットとして「AAC、APAC、MP3、Apple Lossless、FLAC」などを挙げています。同じflacのファイルが、iPhoneでは鳴るのに、あるサービスの一覧には載っていない。これが実態です。

「再生できる形式」と「文字起こしできる形式」は別物

混乱の元になるので分けて書きます。Microsoft 365(SharePoint / OneDrive / Stream)で再生できるオーディオ・ビデオ形式の一覧は公式に出ていて、M4A・MP3・WAV・WMAを含みます。これは再生の話で、文字起こしの対象範囲とは一致しません。

つまり、置き場所で普通に再生できることは、文字起こしが通る根拠になりません。「聞けるのに文字にできない」は正常な挙動です。

もうひとつ、形式が合っていても処理できない場合があります。Microsoftは「DRM保護されたビデオファイルを再生することはできません」と明記しています。購入した音源のように保護が掛かったファイルは、拡張子だけ見ても分かりません。

まず確かめる順番

  1. 渡す先の公式ヘルプで、対応形式の一覧を見る。 サービスごとに違うので、他所の記事の表を信じない
  2. その形式が一覧に無いなら、一覧にある形式へ変換する。 変換の手順はこのあとWindows/Macに分けて書きます
  3. 一覧にあるのに読めないなら、形式の問題ではない。 ファイルの破損か、保護の掛かったファイルを疑う

iPhone 1台で完結する道順

パソコンを開かずに済ませる手順です。

  1. ファイルを「ファイル」アプリに入れる。 メール添付なら共有メニューから「"ファイル"に保存」。AirDropで受けたものも同じ場所に入ります
  2. 文字起こしのアプリやサービスの「取り込み」からそのファイルを選ぶ
  3. あとは自分で録った音声と同じ流れです

つまずくのは、たいてい1です。LINEで受け取った音声は、LINEのトーク内に留まっていてファイルアプリから見えないことがあります。トーク内の音声を開いて共有 →「"ファイル"に保存」を経由してください。

iPhoneだけでどこまでできるか

「パソコンを開かずに済ませたい」と考えている人向けに、iPhone側の標準機能で公式に確認できることを整理します。結論を先に書くと、自分で録ったものは強く、もらったファイルは弱いです。

やりたいこと公式に確認できる条件
ボイスメモの録音を文字に起こすiPhone 12以降。日本語を含む対応言語。一部の国や地域では利用不可
メモアプリの録音を文字に起こすiPhone 12以降で、デバイスの言語が日本語などに設定されていること
通話を録音して文字起こしを見るiOS 18.1以降
もらった音声ファイルを読み込む公式ヘルプに記載を確認できませんでした

ボイスメモとメモアプリの文字起こしは、どちらもiPhone 12以降という機種の線が公式に引かれています。ボイスメモ側は対応言語で、メモアプリ側は「デバイスの言語」がその言語に設定されていること、と条件の書き方が少し違います。英語に設定して使っている人は、メモアプリのほうで引っかかります。

通話の録音と文字起こしはiOS 18.1以降です。国や地域については、Appleは利用できない国・地域を列挙する形で書いていて、そこにはEUやロシアなどが含まれます。日本で使えるかどうかは、Appleの「iOSとiPadOSで利用できる機能」のページで確認するよう公式が案内しているので、そちらで実物を見てください。

外部のファイルを読み込めるかは、公式に書かれていない

ここは正直に書きます。ボイスメモやメモアプリに、人からもらったmp3を読み込めるかどうかは、Appleの公式ヘルプに肯定・否定のどちらの記述も見つけられませんでした。手順が書かれているのは録音する側だけです。

同じく、iPhone単体で1本の音声を2つ以上に分割する公式の手順も確認できませんでした。ボイスメモにあるのはトリミングで、これは前後を切る操作です。長い音声を前半・後半に分けたいなら、このあとのWindows/Macの手順に回ることになります。

ボイスメモで前後を切る手順

会議の前後に入った雑談や、始まる前の空白を落とすだけなら、iPhoneで完結します。公式の手順はこうです。

  1. ボイスメモアプリで、編集する録音をタップする
  2. 黄色のトリミングハンドルをドラッグして、残したい/消したい範囲を囲む(波形はピンチで拡大できる)
  3. 残すなら「トリミング」、消すなら「削除」をタップする
  4. 「適用」をタップしてから、「完了」をタップする
  5. 「録音を保存」で上書きするか、「新規録音として保存」を選ぶ(オリジナルはそのまま残る)

5で必ず「新規録音として保存」を選んでください。上書きしてしまうと、切りすぎたときに戻せません。会議の録音は取り直しがきかないので、ここは元を残す一手間に見合います。

文字起こしの結果は、そのまま配らない

Appleは通話の文字起こしについて「文字起こしを信頼する前に、精度を確認してください。会話を完全に再現できていない可能性があります」と公式に注記しています。文字起こしが表示されないときの原因についても、機種の要件を満たしていないか、対応する言語を検出していないか、と説明しています。

出てきたテキストは下書きです。人から預かった音声はなおさらで、録音した場所も参加者も分からないぶん、固有名詞の確認は自分で録ったとき以上に丁寧にやることになります。

会議の録画(mp4)の場合

Zoomなどの録画から文字を起こしたいときは、2つだけ気をつけてください。ローカル保存のファイルを使う。 クラウド録画はリンクであってファイルではないので、多くの取り込みには使えません。録画ファイル(mp4)そのものをダウンロードしてから渡します。

画質は関係ありません。 処理されるのは音声トラックだけなので、ファイルを小さくしたければ画質を落として構いません。音声だけは触らないでください。

どこから来たファイルかで、見るところが変わる

同じmp3でも、ICレコーダーから来たのか、Web会議の録画から来たのかで、詰まる場所が違います。渡す前に、この3つを順に見てください。

音声だけのファイルになっているかそのまま渡す音だけ取り出す1本に収まっているかそのまま渡す分けて渡す形式が一覧に載っているかそのまま渡す変換して渡す
渡す前の3つ。1つでも「いいえ」なら、先に手を入れる。

ICレコーダーから来たファイル

すでに2本に割れていることがあります。ソニーの公式ヘルプガイドは「システム制約でファイルサイズの上限(LPCMは4 GB、MP3は1 GB)を超えて録音する場合は、ファイルが分割されます」と書いています。長い会議を高音質で録った人のフォルダには、意図せず分かれた続きものが入っています。

1本に収まる長さも機種と録音モードで決まります。ICD-UX570Fの内蔵メモリーの場合、1ファイルの最大録音可能時間はLPCM 44.1kHz/16bitで5時間20分、MP3 192kbpsで12時間25分と公式に書かれています。非圧縮で録ると、1本に収まる長さが半分以下になります。

パソコンへの取り出しは、USBでつないでドラッグアンドドロップです。公式手順は「「IC RECORDER」または「MEMORY CARD」に入っているファイルやフォルダをパソコンのローカルディスクにドラッグアンドドロップします」となっています。

Web会議の録画

まず、手元に落とせるかどうかが最初の関門です。Teamsの公式ヘルプは「会議のレコーディングをダウンロードできるのは、会議の開催者だけです」と明記しています。参加者として文字起こしに回したいなら、開催者に落としてもらうところから始まります。

サービス保存先と形式(公式の記載)
Teams.mp4。非チャネル会議は開催者のOneDrive、チャネル会議はチャネルのSharePointサイト
Zoom(ローカル録音)音声のみは audio[乱数].m4a、映像込みはmp4
Google Meet主催者のドライブの「Google Meet」フォルダ。拡張子の記載は確認できませんでした

Teamsの録画を落とす操作は、会議チャットまたはチャネルで「共有」タブを選び、記録を選んで「その他のオプション」からダウンロードです。Zoomは音声だけのm4aが最初から出るので、映像を捨てる手間が要りません。

Google Meetには先に確かめることがあります。公式ヘルプは「会議の録画は、パソコンまたは Android デバイスでのみ可能です」と書いていて、文字起こし機能も「パソコン、ノートパソコン、Android デバイスでのみご利用いただけます」と書かれています。iPhoneしか持っていない人は、録画そのものが取れません。

さらにMeetの文字起こしは、Business StandardやEnterprise StandardなどのGoogle Workspaceのエディションに限られます。無料のGoogleアカウントはこの一覧に入っていません。

スマホの画面収録

Web会議の音を画面収録で拾おうとして空振りすることがあります。Appleは「一部のアプリでは、そのコンテンツの録画が許可されていない場合があります。画面の収録とミラーリングの使用を同時に行うことはできません」と公式に書いています。

アプリ側が許可していなければ、設定をどう変えても録れません。この場合は録画そのものを諦めて、会議の録画機能に切り替えるほうが早いです。

人からもらったファイル

メールで届いた音声は、添付の時点で削られている可能性があります。Gmailの個人アカウントは上限が25MBで、超えると「添付ファイルが自動的に削除され、Google ドライブのリンクとしてメールに追加されます」と公式に書かれています。受け取った側は「添付が無い」と誤解しがちです。

iCloudメールは送受信とも1通20MBで、Mail Dropを使えば最大5GBまで送れます。ただしMail Dropの添付は「メールの送信後、受信者は30日以内に」ダウンロードする必要があります。放置した音声は取り出せなくなります。

届いた添付をiPhoneに入れるには、添付ファイルをタッチして押さえたままにしてから「"ファイル"に保存」をタップします。置き場所としてのGoogleドライブは、Google形式に変換しないファイルなら5TBまで置けるので、容量そのものが問題になることはまずありません。

Windowsで下準備する

Windowsには標準でClipchampが入っています。動画から音を取り出す、長い音声を切る、無音を削る、といった作業はここで完結します。追加のソフトを入れずに済むのが利点で、書き出せる形式が狭いのが欠点です。

音だけにする要らない所を切る音量を整える書き出す
下準備は4段。上から順にやると、やり直しが減る。

動画から音声だけを切り離す

会議の録画は映像を捨てるだけでファイルが軽くなります。Clipchampの公式手順は、タイムラインで動画を選び、プロパティパネルの「オーディオ」タブから「オーディオのデタッチ」ボタンをクリックする、というものです。デタッチした音声は自動でパソコンにダウンロードされます。

書き出しから取り出す道もあります。エクスポートで「オーディオのみ」を選ぶと、MPEG-4(.m4a)の音声ファイルになります。Clipchampからmp3では出せません。公式ヘルプも「ビデオは MP4 としてエクスポートされ、オーディオのみのプロジェクトは M4A として保存されます」と書いています。

長い音声を切る

分割の手順は単純です。タイムラインでオーディオを選び、シーカーを分割したい位置へ動かして、分割ボタン(ハサミのアイコン)をクリックします。キーボードのSキーでも同じことができます。

無音を削る

Clipchampには無音削除があり、全ユーザーが無料で使えると公式に書かれています。拾うのは3秒を超える無音だけで、それより短い間は残ります。細かい沈黙まで詰めたい用途には向きません。

  1. AI提案ボタン(キラキラのアイコン)をクリックする
  2. 自動カットを選ぶ
  3. 言語を選んで文字起こしを走らせる
  4. 見つかった無音を個別に「削除」するか、まとめて「すべて削除」する

条件がひとつあります。公式ヘルプは「Your video must include audio or voice」と書いていて、音声または声が入っていることが前提です。また不自然な切れ目にならないよう、わずかな間はあえて残すとも書かれています。

ノイズと音量

ノイズ抑制は、プロパティパネルの「オーディオ」タブにある「ノイズ抑制」のスイッチをオンにします。動画に埋め込まれた音声には直接掛けられません。公式ヘルプは「オーディオが埋め込まれたビデオ クリップの場合は、最初にオーディオを取り外す」と指示しています。順番を間違えるとスイッチが効きません。

音量は同じタブのスライダーで、0%(ミュート)から最大200%まで調整できます。公式には「オーディオ品質を犠牲にすることなく最大 200% に調整します」とあります。なお、音量を自動で揃える機能(ノーマライズ)の記載は公式ヘルプに見つけられませんでした。小さい声を持ち上げたいなら、手で上げることになります。

読み込めないとき

「サポートされていないファイル形式」と出た場合、公式の指示は無料の変換ツールでMP3かOGGに変換することです。変換ツール自体は外部のものを想定した書き方になっています。

対応形式の一覧に載っているのにこのエラーが出るなら、原因は別です。公式ヘルプは「追加しようとしているメディアファイルが破損しており、Clipchampで使用する前に修復が必要な可能性があります」と説明しています。一覧に載っている形式で弾かれたら、形式ではなくファイルを疑ってください。

新しい機材で撮った動画にも線があります。ClipchampはAV1でエンコードされたビデオとHDRのメディアアセットに対応していません。会議の録画では起きにくいものの、スマホやカメラで撮った素材から音を抜くときに当たります。

Macで下準備する

Macも標準アプリだけで足ります。動画から音を抜くのと長い音声を切るのはQuickTime Player、形式を変えるのは「ミュージック」かGarageBand、と役割が分かれているのがWindowsとの違いです。

やりたいこと使うアプリ操作
動画から音だけ取り出すQuickTime Player「ファイル」>「書き出す」>「オーディオのみ」
長いファイルを分けるQuickTime Player「表示」>「クリップを表示」→「編集」>「クリップを分割」
前後を切るQuickTime Player「編集」>「トリミング」→ 黄色のハンドルをドラッグ
M4AをMP3にするミュージック読み込み設定でMP3エンコーダ →「MP3バージョンを作成」

動画から音声だけを取り出す

QuickTime Playerで動画を開き、「ファイル」>「書き出す」>「オーディオのみ」を選びます。出てくるのは、公式の説明によれば「Apple MPEG 4オーディオファイルで、AACオーディオトラックが含まれています」。拡張子はm4aになります。

会議の録画を渡すときは、これだけでファイルが大きく軽くなります。文字起こしに使われるのは音声だけなので、映像を捨てても結果は変わりません。

長いファイルを分ける

QuickTime Playerの手順は次のとおりです。

  1. 「表示」>「クリップを表示」を選ぶ
  2. 再生ヘッド(赤色の垂直線)を、分割したい位置へ移動する
  3. 「編集」>「クリップを分割」を選ぶ。必要な数になるまで繰り返す
  4. 「完了」をクリックし、「ファイル」>「保存」で保存する

前後を落とすだけなら、分割ではなくトリミングです。「編集」>「トリミング」を選び、トリミングバーの黄色いハンドルをドラッグして残す範囲を決め、「トリミング」をクリックします。ハンドルを押したままにするとフレーム単位で確認できます。

M4AをMP3にする

Appleが公式に案内している道は2つあります。ひとつは「ミュージック」を使う方法です。

  1. 「ミュージック」>「設定」→「ファイル」タブの「読み込み設定」を開く
  2. 「読み込み方法」で「MP3エンコーダ」を選び、「OK」で保存する
  3. 変換したいファイルをドラッグして選ぶ
  4. 「ファイル」>「変換」>「MP3バージョンを作成」を選ぶ
  5. 「ファイル」>「Finderで表示」で、できたファイルの場所を開く

もうひとつはGarageBandです。「ファイル」>「新規」>「空のプロジェクト」を作り、音声ファイルをトラック領域にドラッグして、「共有」>「曲をディスクに書き出す」から「MP3」を選んで書き出します。

とりあえずmp3、が裏目に出ることがある

変換には代償があります。Appleは「圧縮されたフォーマットから圧縮されたフォーマットに変換した場合(MP3とAACの間の変換など)は、音質の変化が目立つことがあります」と公式に注意しています。手元のm4aがそのまま通るなら、mp3に変換しないほうがいいということです。

買った音源はそもそも変換できません。公式には「iTunes Storeで購入したもので変換できるのは、iTunes Plusの曲だけです」とあります。

録る前に決めておけること

Macのボイスメモには、設定に「オーディオの品質」があります。「ボイスメモ」>「設定」で、「非可逆圧縮」(品質が低く、ファイルサイズが小さい)か「ロスレス圧縮」(品質が高く、ファイルサイズが大きい)を選べます。

録る前にサイズを決められる、数少ない公式のつまみです。あとから渡す予定があるなら、ここを先に見ておくと変換の工程が丸ごと消えます。

m4aで詰まるとき

m4aはiPhoneのボイスメモが作る形式なので、この分野でいちばん多く出回ります。対応しているサービスは多いのですが、詰まるとしたら次の3つです。

1つめ、拡張子が .m4a ではなく .M4A になっている。大文字と小文字を区別する受け口だと、対応形式の一覧に入っていても弾かれます。ファイル名を変えるだけで通ります。

2つめ、中身がm4aではない。拡張子だけ書き換えたファイルは、開いた先で読めません。変換したつもりで名前を変えただけ、という取り違えは実際に起きます。

3つめ、大きさ。m4aは圧縮されているので比較的小さいのですが、それでも長時間の録音は数十MBになります。アップロードの上限に当たっていないか、先に見てください。

iPhoneから取り出す手順そのものは難しくありません。ボイスメモで録音を開き、共有のボタンから「ファイルに保存」を選べば、iPhoneの中に置けます。そこから先は、渡したいサービスのアップロードの欄で選ぶだけです。パソコンへ渡す場合の経路はボイスメモをパソコンに保存するにまとめました。

mp3に変換したほうがよいのか

「とりあえずmp3にしておけば安全」という考え方は、半分正しく半分無駄です。

状況変換すべきか
渡す先の対応形式にm4aが入っている要らない
対応形式がmp3だけ変換する
相手に送って、環境が分からないmp3にしておくと安心
音質をできるだけ保ちたい変換しない(再圧縮で劣化する)

いちばん大事なのは最後の行です。m4aからmp3への変換は、圧縮された音をもう一度圧縮することになります。人の耳で分かる差は小さいものの、機械の認識にとっては情報が減ります。対応しているなら、そのまま渡すほうが素直です。

変換が必要なときは、パソコンの標準の道具でできます。オンラインの変換サイトは手軽ですが、会議の音声を知らない相手のサーバーに預けることになるので、社外の人が入っていた会議では避けたほうが無難です。

mp4(動画)をそのまま渡してよいか

会議の録画はmp4で残ることが多く、そのまま受け付けるサービスも珍しくありません。渡せるなら、音声だけ取り出す手間が省けます。

ただし2つ注意があります。ファイルが大きいことと、処理に時間がかかることです。1時間の録画は数百MBから数GBになるので、アップロードの上限に当たりやすい。音声だけ取り出せば数十MBに落ちます。

取り出し方は、パソコンの動画編集の道具でも、変換の道具でもできます。音声だけにしてから渡すほうが、上限にも時間にも余裕が出ます。録画から議事録を作るまでの流れは動画から議事録を作るにまとめました。

Wordのトランスクリプトで起こす

パソコンに入っている道具だけで完結させたいなら、Wordのトランスクリプトが最短です。ただし条件が細かく、当てはまらない人がかなりいます。先に条件から書きます。

音声を用意ディクテーショントランスクリプトアップロード
手元の音声を渡すまで。押す場所は決まっている。

手順

  1. Wordで[ホーム]タブを開く
  2. [ディクテーション]のドロップダウンを開く
  3. [トランスクリプト]を選ぶ
  4. [トランスクリプト]ウィンドウで[オーディオのアップロード]を選ぶ
  5. 処理が終わるまで、ウィンドウを開いたまま待つ

5は公式の指示です。「文字起こしが行われている間は 必ず [トランスクリプト] ウィンドウを開いたままにしておいてください」と書かれています。ほかの作業やタブの切り替えは構いません。

待ち時間の目安も公式にあります。「インターネットの速度によっては、トランスクリプトにオーディオ ファイルの長さくらいまでの時間がかかる場合があります」。1時間の会議なら1時間近く見ておく、という読み方になります。

条件

項目公式の記載
対応形式.wav / .mp4 / .m4a / .mp3
月の上限Microsoft 365は月300分、Copilotライセンスは月30,000分
動く場所商用テナントのWindows版Word。政府機関テナントはWeb版のみ
ブラウザ新しいMicrosoft EdgeとChromeのみ
1文書あたりトランスクリプトは1本だけ。新しく作ると前のものが消える

月300分は1本の長さではなく月合計で効きます。1時間の会議なら5本で使い切ります。ここを月ごとの残量として見ておかないと、月末に急に通らなくなります。

Macで使いたい人は注意が要ります。デスクトップ版は「商用テナントの Windows 上の Word for Microsoft 365 でのみ使用できます」と書かれていて、Web版はEdgeとChromeでしか動きません。MacのSafariで開いても機能が出てきません。

言語は「日本語 (日本)」が対応の一覧に明記されています。ここは心配要りません。

話者ラベルの扱い

Wordのトランスクリプトは「異なる話者を識別して分離し、"Speaker 1"、"Speaker 2" などのラベルを付けます」。名前を入れたいときは[すべての話者の変更]を使うと、そのラベルの全出現箇所がまとめて置き換わります。

ここで大事なのは、このラベルが1本のトランスクリプトの中で完結していることです。別のファイルを起こした結果の「Speaker 1」が同じ人だとは限りません。長い音声を分けて処理するときは、この点があとで効いてきます。

音声はどこへ行くか

Microsoftは「お客様のオーディオ ファイルは Microsoft に送信され、このサービスを提供するためだけに使用されます。トランスクリプトが完了すると、音声とトランスクリプトの結果は Microsoft のサービスによって保存されません」と公式に書いています。手元で完結する処理ではありません。

ただしアップロードした音声そのものはOneDriveに残ります。「録音は、OneDrive の [トランスクリプトされたファイル] フォルダーに保存されます。」と書かれているので、消したい場合は自分でそこから削除します。

なお、1ファイルあたりのサイズ上限(MB)は公式に記載を確認できませんでした。日本語版・英語版の公式ページを通しで読みましたが、書かれているのは月の分数だけです。よく引用される「200MB」という数字の裏付けは取れていません。

ファイルが大きくて弾かれるとき

サイズの上限を公式に書いているサービスは、実は多くありません。数字が明記されているものだけを並べます。ここに無いサービスは、上限が無いのではなく、公表されていないだけです。

どこ公式に書かれている線
Stream のトランスクリプト4GB未満かつ4時間未満のビデオのみ
NotebookLM1ファイル200MBまで、1ソース50万語まで
Gmail(個人)添付25MBまで。超えるとドライブのリンクに置き換わる
iCloudメール1通20MBまで。Mail Dropなら最大5GB(30日でダウンロード期限切れ)
Googleドライブ変換しないファイルは5TBまで

自分のファイルがどのくらいの大きさになるかは、録画の設定で決まります。Zoomは自社の目安を公表していて、画面共有の録画は1時間あたり約20MB、ビデオの録画は1時間あたり約200MBとしています。映像が入るだけで10倍になる、という桁感です。

減らす順番

上から順にやると、失うものが少なくて済みます。

映像を捨てて音声だけにする結果は変わらない要らない前後を切り落とす会議の外側だけ無音の長い区間を削る間は少し残る1本を2本に分ける時刻と話者が切れる
大きさを減らす順。上ほど失うものが少ない。

1番目でだいたい片が付きます。文字起こしに使われるのは音声トラックだけなので、映像を捨てても結果は変わりません。Windowsなら「オーディオのデタッチ」、MacならQuickTime Playerの「オーディオのみ」で取り出せます。

2番目は前後の切り落としです。開始前の待ち時間と終了後の雑談は、たいてい合わせて数分あります。切るとサイズが減るうえに、文字起こしの結果に関係のない行が混ざらなくなります。

形式を変えても、あまり小さくならない

「圧縮すれば通る」と考えて変換に走る前に、いま何で録られているかを見てください。wavのような非圧縮のファイルなら、mp3やm4aにするだけで大きく減ります。もともとmp3やm4aなら、変換してもたいして小さくなりません。

しかも代償があります。Appleが書いているとおり、圧縮形式から圧縮形式への変換は音質の変化が目立つことがあります。得るものが小さく、失うものがあるなら、やらない判断が正しいです。

分けるのは最後の手段

分割はいちばん効きますが、いちばん壊れます。時刻の連続性と話者ラベルの対応が切れるためで、詳しくはこのあとに書きます。上の3つで足りるなら、分けないほうがきれいに終わります。

文字起こしの前に音を整える

無音を切る、音量を均す、ノイズを取る。よく勧められる下処理ですが、それが文字起こしの精度を上げると書いた公式の記載は見つけられませんでした。機能そのものは公式に存在します。効果のほうは、公式の裏付けが無いという前提で読んでください。

そのうえで、やる意味がはっきりしているものと、意味が無いものを分けます。

やること意味があるか
映像を捨てて音声だけにするある。ファイルが軽くなり、通る確率が上がる
前後と無音を切るある。処理する長さが減り、利用枠の消費も減る
ノイズ抑制・音量調整機能はある。精度への効果は公式に確認できませんでした
再生時の設定を変える無い。ファイルそのものが変わらない

再生時の設定は、渡す音を変えない

いちばん誤解されるところです。iPhoneのボイスメモには「無音をスキップ」「録音補正」といった設定がありますが、Appleは「これらの設定を変更しても、録音データ自体は影響を受けません」と公式に注記しています。

つまり、ここで聞きやすく整えてから書き出しても、書き出したファイルは元のままです。前処理には使えません。ここで整えるのは、自分が聞き返すときのためだけです。

録る側で変えられること

再生時ではなく録音時に効く設定もあります。ボイスメモのマイクモードがそれで、コントロールセンターを開き、上部の「ボイスメモ」をタップして選びます。周囲の音を除くなら「声を分離」、含めるなら「ワイドスペクトル」です。

ただし公式には「「ワイドスペクトル」は、iPhoneのモデルによってはご利用いただけません」とあります。これは次の会議のための設定で、すでに手元にあるファイルには効きません。

削る側の下処理

Windowsなら、上のClipchampの項目に書いた無音削除とノイズ抑制が使えます。無音削除が拾うのは3秒を超える無音だけで、ノイズ抑制は音声クリップに対して効くため動画は先にデタッチが要る、という2点は押さえておいてください。

音量は0%から200%までの手動調整です。自動で音量を揃える機能の記載は、公式ヘルプに見つけられませんでした。話者ごとに声の大きさが違う録音を、機械的に均す標準の道は用意されていません。

音が悪すぎると、そもそも受け付けられない

下処理の話とは別に、入口で弾かれる条件があります。NotebookLMの公式ヘルプは「発話が含まれていない音声はサポートされていません」と書き、さらに「ヒント: 音声の品質が低い場合は、インポートに失敗することがあります」と注意しています。

「入れたのに何も起きない」は、音の状態が原因のことがあります。まず自分で最後まで再生して、人の声が聞き取れるかを確かめてください。ここが駄目なら、下処理でどうにかなる範囲を超えています。

長い音声を分けると、何が壊れるか

先に正直なところを書きます。分割したファイル間で時刻の起点がどうなるか、話者ラベルがどう振り直されるかについて、Apple・Microsoft・Googleの公式ヘルプに記載を見つけられませんでした。近い記載として確認できたのは、次の2つだけです。

ひとつは、Wordが話者を識別して「Speaker 1」「Speaker 2」とラベル付けすること。もうひとつは、TeamsのライブトランスクリプトをStream側で編集すると「話者の属性を失います」と公式に明記されていることです。

公式の記載から言えること

起きること根拠として確認できたこと
2本目の話者ラベルが1本目と対応しないラベルは1本のトランスクリプトの中で付けられる
1文書にまとめられないWordは1文書につき1トランスクリプトのみ。新しく作ると前が消える
編集の順番を誤ると話者が消えるTeamsのトランスクリプトを編集すると話者の属性を失う

2番目は実務でいちばん効きます。Wordは「1 つのドキュメントにつき 1 つのトランスクリプトのみを格納できます」と書いているので、前半・後半を1つの文書に順番に足していく使い方はできません。前半のトランスクリプトが消えます。

分けて処理するなら、文書も分けてください。そのうえで、テキストになった段階で手作業でつなぐことになります。

分けるときに決めておくこと

  1. 話題の切れ目で切る。時計で30分ちょうどに切ると、1つの議題が2本にまたがって読みにくくなります
  2. ファイル名に通し番号と開始時刻を入れる。会議_01_0000 会議_02_2830 のように、元の音声で何分から始まるかを名前に残します
  3. 2本目以降の時刻は、開始時刻を足して読む。起点が0に戻る前提で見ておけば、あとで混乱しません
  4. 話者の名前を付けるのは最後。先に付けると、2本目で同じラベルが別人を指していることに気づけません

重ねて切るという手

もう少し丁寧にやるなら、区間どうしを少し重ねます。重なった部分には同じ発言が入るので、両方の結果に同じ内容の行が出ます。そこを突き合わせれば、1本目の話者Cと2本目の話者Aが同じ人だと、推測ではなく照合で決まります。

重なりは短すぎると誰も喋っていない区間になって役に立たず、長すぎると同じところを二度処理することになります。手作業でやるなら、1分ほど重ねておけば足ります。

なぜこの崩れが起きるのかは長い会議で、話者が途中から入れ替わる理由に詳しく書きました。話者分離そのものの限界については話者分離の実測にあります。

詰まったときの見分け方

「対応していない形式です」と出る。 上の表のWMA・独自形式です。パソコンで一度mp3かwavに変換してください。無料の変換ソフトで足ります。

形式は合っているのに読み込めない。 疑うのは3つです。

  1. DRM(著作権保護)付きの音声。購入した音源などは形式が合っていても処理できません
  2. ファイルの破損。途中で切れた録音は、末尾が壊れていて開けないことがあります。再生アプリで最後まで再生できるかを先に確かめてください
  3. サイズと長さの上限。サービスごとに1ファイルの上限があります。超えている場合は分割です

長時間ものが途中までしか起こされない。 エラーにならずに静かに途切れる場合があります。長い録音は、仕上がりの最後の時刻が元の長さと合っているかを必ず見てください。

うまくいかないとき、公式に原因が書いてあるもの

原因の見当がつかないまま設定をいじると時間が溶けます。公式ヘルプに原因が明記されている症状だけを、対処と対にして並べます。ここに当てはまらないなら、別のところを探したほうが早いです。

症状公式に書かれている原因対処
「サポートされていないファイル形式」と出る(対応一覧にある形式なのに)ファイルが破損している可能性別の再生アプリで最後まで再生してみる。駄目なら元をもらい直す
一覧に無い形式で読み込めない対応外公式の指示どおりMP3かOGGに変換してから読み込む
新しいカメラで撮った動画が読めないAV1でエンコードされた動画とHDR素材は非対応別のアプリで音声だけ書き出してから渡す

Clipchampの2つ目と3つ目は取り違えやすいところです。一覧に載っている形式で弾かれたら、形式ではなくファイルを疑う。これが公式の案内です。

症状公式に書かれている原因対処
取り込みに失敗する(NotebookLM)発話が含まれていない、または音声の品質が低い人の声が聞き取れるかを自分で再生して確かめる
Wordに[トランスクリプト]が出てこない商用テナントのWindows版Wordのみ。政府機関テナントはWeb版のみWeb版に回る
Web版Wordでボタンが反応しない新しいEdgeとChromeのみで動作ブラウザを変える。Safariでは動かない
月の途中で急に通らなくなったMicrosoft 365は月300分まで翌月まで待つか、別の道具に回す

Wordはここで落ちる人が多い箇所です。Macを使っていて、SafariでWeb版を開いている人は二重に外れます。Edgeを入れるか、別の方法へ切り替える判断になります。

症状公式に書かれている原因対処
会議の録画をダウンロードできない(Teams)ダウンロードできるのは会議の開催者だけ開催者に落としてもらう
Google Meetで文字起こしが見当たらないパソコンとAndroidのみ。対象エディションも限られるパソコンから操作する。エディションを確認する
画面収録に音が入らない一部のアプリはコンテンツの録画を許可していない会議側の録画機能に切り替える
もらった添付が開けなくなったMail Dropの添付は30日でダウンロード期限切れ送り直してもらう

Teamsの1行目は、作業を始める前に確かめておくところです。参加者として渡してもらう約束をしていても、開催者が落とせることを知らないまま止まっている場合があります。

最後にもうひとつ。買った音源は形式が合っていても変換で詰まります。Appleは「iTunes Storeで購入したもので変換できるのは、iTunes Plusの曲だけです」と書いています。取材や会議の録音では起きませんが、講演の購入音源などでは当たります。

無料でやるか、道具に載せるか

1本だけなら、無料の選択肢で足ります。どこまで無料で行けるかは文字起こしを無料でやる方法に線を引いてあります。

毎週来るなら、取り込み→文字起こし→議事録まで1本の流れになっている道具のほうが早くなります。Recoryの場合、一覧画面の取り込みから音声(mp3・wav・m4aなど)と動画(mp4・mov)を選べて、自分で録った会議と同じように議事録まで進みます。WMAと独自形式は上の表のとおり事前に変換してください。取り込んだ音声も利用時間の枠を使うので、何十時間ぶんを一気に、は通りません。

なお、文字起こしのあとに直す工程が必ず残ります。とくに人から渡されたファイルは録音条件が分からないので、固有名詞と話者の確認は自録りより丁寧に。手順はテープ起こしをAIで速くするにまとめました。


ICレコーダーからの取り込みは専用の手順に、ボイスメモで録ったものの扱いはiPhoneで録った音声を文字にするにあります。

人から預かった音声を、外のサービスに渡す前に

自分で録った音声と、人から預かった音声は、扱いが違います。どこまで気にするべきかの線を、一次情報から引いておきます。

個人情報保護委員会は、通話の録音について「通話内容から特定の個人を識別することが可能な場合には個人情報に該当します」としています。そのうえで「個人情報取扱事業者は、個人情報保護法上、利用目的を通知又は公表する義務を負いますが、録音していることについて伝える義務までは負いません」と書いています。

識別できない録音については「基本的には個人情報に該当しません」としつつ、「その他の情報と容易に照合でき、それによって特定の個人を識別することができれば、その情報とあわせて全体として個人情報に該当することはありますので、個別の事例ごとの判断が必要です」と続きます。参加者名簿と突き合わせられる会議の録音は、この「容易に照合できる」に近づきます。

クラウドに預けるとき

外部のサービスに音声を渡すのは第三者提供にあたるのか。ここも一次情報があります。個人情報保護委員会は、クラウドサービス提供事業者が「当該個人データを取り扱わないこととなっている場合には、当該個人情報取扱事業者は個人データを提供したことにはならないため、「本人の同意」を得る必要はありません」としています。

ただし条件付きです。公式は「契約条項によって当該外部事業者がサーバに保存された個人データを取り扱わない旨が定められており、適切にアクセス制御を行っている場合等」と書いています。「クラウドだから同意は要らない」ではありません。契約とアクセス制御が前提です。

渡した音声がどこに残るか

サービス側の説明を見ておくと判断しやすくなります。Wordのトランスクリプトについて、Microsoftは音声がMicrosoftに送信され、このサービスを提供するためだけに使われ、完了後は音声も結果も保存されない、と公式に書いています。

一方で、アップロードした音声ファイル自体はOneDriveの「トランスクリプトされたファイル」フォルダーに残ります。預かった音声を扱ったら、作業のあとにここを見てください。残っていること自体は仕様で、消すかどうかは使う側の判断です。

録音する側に回るとき

これから録るなら、Appleの案内が参考になります。通話録音の手順の冒頭で「録音しても問題ないことを通話相手に確認してください」と書き、通話が録音されることがオーディオ通知で双方に知らされる、とも明記しています。

iPhoneには、マイクが使われているときに画面上部にオレンジ色のインジケータが出る仕組みもあります。録っていることが相手にも自分にも分かる作りになっている、と考えておくのが実態に近いです。

ここまでは法令とサービスの一次情報の話です。社内規程や相手先の規則は、これとは別に効きます。取引先の会議室で録るなら先方のルールが、社内なら自社の規程が優先します。個別の判断は弁護士にご確認ください。

手元にあるファイルを渡す手順が中心です。作業そのものの全体像は文字起こしとはにあります。


手元のファイルを取り込んで議事録まで進める道具を探しているなら、Recoryは音声(mp3・wav・m4aなど)と動画(mp4・mov)の取り込みに対応しています。仕様は2026年9月2日時点の公式サイトの記述に基づきます。OSのバージョンで名前や場所が変わるので、お手元でご確認ください。

よくある質問

mp3のファイルをiPhoneだけで文字起こしできますか

できます。mp3は最も広く対応されている形式で、ほぼどのアプリ・サービスでもそのまま読み込めます。ファイルアプリに保存してあれば、文字起こしアプリの取り込み機能から選ぶだけです。パソコンは要りません。

会議の録画(mp4)から文字を起こせますか

起こせます。動画ファイルは音声部分だけが処理の対象になるので、mp4やmovをそのまま受け付けるサービスなら変換は不要です。Zoomの録画を渡す場合は、クラウド録画ではなくローカル保存のファイルを使ってください。

文字起こしできない形式はありますか

WMAと、機器メーカー独自の形式(古いソニー機の.dvfなど)は多くのサービスで読めません。パソコンで一度mp3かwavに変換する必要があります。またDRM(著作権保護)付きの音声は、形式が対応していても処理できません。

Wordの文字起こしは1ファイル何MBまでですか

公式に記載を確認できませんでした。Microsoftの公式ヘルプ(日本語版・英語版とも)に書かれているのは、Microsoft 365で月300分、Copilotライセンスで月30,000分という月合計の枠と、処理に「オーディオ ファイルの長さくらいまでの時間がかかる場合があります」という目安だけです。よく引用される「200MB」という数字は、公式には確認できません。

手元の音声はmp3に変換してから渡したほうがいいですか

渡す先の対応形式の一覧にm4aやwavが入っているなら、変換しないほうがいいです。Appleは「圧縮されたフォーマットから圧縮されたフォーマットに変換した場合(MP3とAACの間の変換など)は、音質の変化が目立つことがあります」と公式に注意しています。変換するのは、いまの形式が一覧に無いときだけで足ります。

会議の録画から音声だけを取り出すにはどうしますか

Windowsなら、Clipchampでタイムラインの動画を選び、プロパティパネルの「オーディオ」タブから「オーディオのデタッチ」をクリックします。デタッチした音声は自動でパソコンにダウンロードされます。Macなら、QuickTime Playerで「ファイル」>「書き出す」>「オーディオのみ」を選ぶと、AACオーディオトラックを含むApple MPEG 4オーディオファイルになります。

長い音声を2本に分けると、話者ラベルはどうなりますか

分割したファイル間で話者ラベルがどう振り直されるかについて、Apple・Microsoft・Googleの公式ヘルプに記載を見つけられませんでした。確認できるのは、Wordが話者を識別して「Speaker 1」「Speaker 2」とラベル付けすること、そのラベルが1本のトランスクリプトの中で付けられることまでです。2本目の「Speaker 1」が1本目と同じ人だとは限らない前提で扱ってください。

iPhoneだけで音声ファイルを2つに分割できますか

iPhone単体で1本の音声を2つ以上に分割する公式の手順は、Appleのヘルプに見つけられませんでした。ボイスメモにあるのはトリミングで、これは前後を切る操作です。前半・後半に分けたいなら、MacのQuickTime Player(「編集」>「クリップを分割」)か、WindowsのClipchamp(ハサミのアイコン、またはSキー)に回ることになります。

無音を切ると文字起こしの精度は上がりますか

精度が上がると書いた公式の記載は見つけられませんでした。機能そのものは公式にあり、Clipchampの無音削除は3秒を超える無音や間を自動で見つけて削除します(全ユーザー無料)。確実に言えるのは、処理する長さが減ってファイルが軽くなることまでです。

Teamsの会議録画を、参加者が自分で文字起こしできますか

そのままではできません。Microsoftの公式ヘルプは「会議のレコーディングをダウンロードできるのは、会議の開催者だけです」と明記しています。録画は.mp4で、非チャネル会議は開催者のOneDrive for Business、チャネル会議はチャネルのSharePointサイトに保存されます。まず開催者に落としてもらってください。

MacのWordで音声ファイルの文字起こしはできますか

デスクトップ版では使えません。公式には「商用テナントの Windows 上の Word for Microsoft 365 でのみ使用できます」とあります。Web版に回る道はありますが、Web版のトランスクリプトは「新しい Microsoft Edge と Chrome でのみ機能します」と書かれているので、Safariでは動きません。

無料で3会議ためす登録もカードも不要・iPhone専用 試す