AI議事録とは何か——中で起きていることから説明する
録音を渡すと議事録が返ってくる。その間に実際は2つの別の処理が走っています。仕組みが分かると、何が得意で何が苦手か、どんな種類があるか、選ぶとき何を見ればいいかが全部つながります。

「AI議事録」という言葉は、実際には2つの別の技術をまとめて呼んでいます。作っている側から、中で起きていることを順に説明します。仕組みが分かると、製品選びで見るべき場所が自然に決まるからです。
この記事の内容(16項目)
1段目にあたる文字起こしという作業そのものは文字起こしとはに分けて書きました。
中で起きていること——2段の処理
録音を渡してから議事録が返ってくるまで、中ではこの順で処理が走ります。
1段目:音声認識(文字起こし)。 音の波形を文字にします。1時間の会議なら3万字前後のテキストになります。この技術は成熟していて、日本語の実勢で90〜95%。どの製品も似た水準です(基盤となるエンジンが数種類に集約されているため)。
2段目:生成AI(議事録化)。 3万字の文字起こしを読ませて、「決まったこと・宿題・経緯」に整理させます。製品の個性はほぼここで決まります。何を残し、どんな形に整えるかは、各社が生成AIに渡している指示の設計だからです。
「AI議事録」と「AI文字起こし」の違いもここです。1段目だけなら文字起こし、2段目まであれば議事録。文字起こしだけの製品に議事録を期待すると、3万字のテキストを渡されて終わります。
「文字起こし」と「議事録」は、別のボタンで動いている
2段に分かれていると言われても、使っているあいだは1つの機能に見えます。ところが各社の画面を見ると、この2つは最初から別のボタンとして置かれています。押す場所が違うということは、片方だけ動いて片方が動かない状態がありうるということです。
| 1段目(文字にする) | 2段目(議事録にする) | |
|---|---|---|
| iPhoneの通話 | 通話中にメニューを開き「通話録音」 | メモで録音を開いて「要約」をタップ |
| Teams | [レコーディングと文字起こし]>[文字起こしの開始] | 会議後にCopilotへ質問する |
| Google Meet | 文字起こしを開始する | 別のアイコンから[メモの作成を開始] |
| Word | [ホーム]>[ディクテーション]>[トランスクリプト] | 2段目にあたる機能は無い |
いちばんはっきりしているのはTeamsです。公式ヘルプには「会議の終了後に Copilot の会話履歴を確認したりするには、会議中にライブ文字起こしをオンにしてください。」とあり、さらに「会議が終了すると、文字起こしされなかった音声テキスト変換データおよび Copilot との対話は利用できなくなります。」と書かれています。2段目は1段目の出力に乗っているので、1段目を取らなかった会議は、終わった時点で素材ごと消えます。
同じ構造はiPhoneにもあります。通話を録音すると文字起こしまでは進みますが、要約はそこで自動的には出ません。メモアプリで録音を開いて「要約」をタップして、初めて2段目が動きます。
保存先が別々なのも、2つが別の工程だからです。iPhoneの通話録音は「iPhoneは自動的に、通話の録音をメモアプリの「通話録音」フォルダに保存します。」と公式にあり、ボイスメモではありません。Google Meetの文字起こしは主催者のGoogleドライブの「Google Meet」フォルダ、Wordで録音・アップロードした音声はOneDriveの「トランスクリプトされたファイル」フォルダに残ります。
消し方も工程ごとに違います。Appleは「オーディオ録音を削除すると、文字起こしも削除されます。」と明記していて、音声だけ整理して文字は残すという運用はできません。片方だけ消えると思って作業すると、必要なほうを落とします。
ここまでを製品選びに直すと、確かめる質問は1つです。その製品は1段目までか、2段目まであるか。Wordの文字起こしは1段目までの道具で、アップロードした音声は「1 か月あたり最大 300 分」(Copilotライセンスは30,000分)と上限も公式に決まっています。1段目だけの道具に議事録を期待すると、長いテキストを渡されて終わります。
1段目が生むのは、テキストだけではない
文字起こしを「読むための文章」だと思っていると、使いどころを半分見落とします。1段目が生んでいるのは、音声のどこに何があるかという索引でもあるからです。
iPhoneのボイスメモでは、録音を検索すると「タイトルまたはオーディオの文字起こしにそのテキストが含まれる録音のみがリストに表示されます。」と公式にあります。ファイル名を几帳面に付けていなくても、中で話した言葉から録音を見つけられるということです。
録音中の様子も見られます。ボイスメモは「波形の上部から上にスワイプし、次にボタンをタップすると、文字起こしの状況をリアルタイムで確認できます。」と書かれています。録れているかどうかを、あとで再生せずに確かめられるのはこの索引があるからです。
そして通話の文字起こしでは、テキストを選ぶとその位置から音声が再生されます。議事録の1行を疑ったときに音へ戻れるか、という話は結局この索引が残っているかどうかで決まります。2段目の出力だけを渡してくる製品が使いにくいのは、ここが手元に無くなるからです。
話者分離とは何か——「誰が」は音の外から来ることがある
議事録で最初に困るのは、文字の間違いより「誰の発言か」のほうです。この、発言を人ごとに割り振る処理を、業界では話者分離(ダイアライゼーション)と呼びます。
ただし断っておくと、この言葉の定義は、Apple・Microsoft・Googleの日本語ヘルプでは確認できませんでした。確認できるのは動作の記述だけです。Appleは「文字起こしでは、それぞれの文の話者が識別されます。」と書き、Wordは「異なる話者を識別して分離し、"Speaker 1"、"Speaker 2" などのラベルを付けます」と書いています。用語ではなく、出てくるものを見るほうが確実です。
出てくるものは、大きく3段階に分かれます。
| 場面 | 公式の記述 | 出てくるもの |
|---|---|---|
| iPhoneの通話録音 | 「それぞれの文の話者が識別されます」 | 文ごとの話者 |
| Teamsのライブ文字起こし | 「各話者の名前とタイム スタンプが含まれます」 | 参加者の名前 |
| Wordの文字起こし | 「"Speaker 1"、"Speaker 2" などのラベル」 | 番号だけのラベル |
| Teams Roomsの会議室 | 「話者を認識しない場合、オーディオは AI ノートの会議室に帰属します」 | 部屋の名前 |
この表の1行目と2行目が易しいのは、音の入り口が最初から分かれているからです。通話は経路が2つあり、Web会議は参加者のアカウントと音声が結び付いています。Teamsの名前は音から当てているのではなく、ログインしている人の名前がそのまま入っています。
その証拠に、Teamsでは「参加者は、会議のキャプションとトランスクリプトで自分のIDを非表示にすることを選択できます」と公式に書かれています。名前がアカウント由来だから、本人の設定で消せるわけです。音から推定しているなら、こういう設定は成り立ちません。
3行目のWordが番号止まりなのは、渡されたのが音声ファイルだけで、名前の手がかりがどこにも無いからです。Wordはラベルを後から一括で付け替えられる作りになっていて、「誰か」を決めるのは人の仕事として設計されています。
いちばん難しいのが4行目、同じ部屋に集まった人たちです。Microsoftの会議室向けの機器でも、室内の個人を名前で識別するには「まず、データを登録してオプトインする必要があります」と公式にあり、登録が無ければ発言は個人ではなく会議室に帰属します。しかも「声紋を登録した招待者が50人を超えると音声による識別は機能しない」と条件まで書かれています。事前登録が要る、人数の上限もある。対面で名前が付かないのは、製品の手抜きではなく、そもそも別の仕掛けが要る領域だということです。
なお、iPhoneのボイスメモとメモアプリの文字起こしが話者を分けるかどうかは、Appleの公式ヘルプで記載を確認できませんでした。話者の識別が明記されているのは通話録音のページだけです。分けられないと断定はできません。ここは実機で確かめる項目として残しておいてください。
この仕組みから、得意と苦手が決まる
得意なこと。 発言を漏らさず拾う(人のメモは書いている間の発言を落とします)。長い会議でも疲れない。終わった瞬間に下書きがある。
苦手なこと。 仕組みの必然として、3つあります。
- 固有名詞。 音声認識は一般的な語の統計で動くので、社名・人名・専門用語は外れます。単語を事前に登録できる製品があるのはこのためです
- 誰が言ったか。 対面の会議では全員の声が1本のマイクに混ざって届くので、話者は音から推定するしかありません。声質の近い人は取り違えます。これはどの製品でも起きます
- 言っていないこと。 質問をはぐらかされた、場が凍った——会議でいちばん大事な情報が「音にならない」ことがあります。これは原理的に拾えません
3つとも「性能が上がれば解決」ではなく、仕組みの側の制約です。だから製品選びは「間違えないもの」ではなく「間違いを確かめられるもの」を探すことになります。詳しくは精度は3つあるに書きました。
「精度98%」は、何を測った数字なのか
比較記事によく出てくる数字ですが、出どころを追いかけると足が止まります。Apple・Microsoft・Googleの公式ヘルプを当たった範囲では、文字起こしの精度をパーセントで示した記載は見つけられませんでした。作っている側は、数字ではなく但し書きの形でしか書いていません。
| 出どころ | 公式に書いてあること |
|---|---|
| iPhoneの通話の文字起こし | 「文字起こしを信頼する前に、精度を確認してください。会話を完全に再現できていない可能性があります。」 |
| iPhoneのライブキャプション | 「ライブキャプションの精度は一定ではなく、危険性の高い場面または緊急事態ではライブキャプションを信頼すべきではありません。」 |
| iPhoneの要約 | 「Apple Intelligenceは生成モデルを使用しており、出力が異なる場合があります。重要な情報は正確性をチェックしてください。」 |
| Google Meetの自動メモ生成 | 「会議の要約が不完全または不正確であったり、生成されなかったりする場合があります」 |
作り手が精度を保証していない、というのがいまの状態です。この記事の前半で「実勢90〜95%」という幅に触れましたが、これも公式に発表された数値ではありません。数字を見たら、次の3つを確かめてください。
- 何を数えた数字か。 日本語は単語が空白で区切られないので、単語単位で数えるか文字単位で数えるかで値が変わります。指標が違う数字は比べられません
- どんな音声で測ったか。 1人が静かな部屋ではっきり話した録音と、5人が同時に喋る会議室では条件がまったく違います
- いつ、誰が測ったか。 出典に年と測定者が書かれていない数字は、追いかけようがありません
一方で、精度に効く条件のほうは公式に名指しされています。数字を比べるより、こちらを潰すほうが早く結果が変わります。
| 見る場所 | 公式の記述 |
|---|---|
| 会議の言語設定 | 「文字起こしの精度を確保するには、会議の話し言葉が全員が話している言語を反映していることを確認します」(Teams) |
| マイクの入力先 | 「コンピューターのマイク入力がヘッドセット マイクに設定されている場合は、対面会議での音声を拾えません。」(Word) |
| 端末の言語 | 「文字起こしが表示されない場合は、お使いのiPhoneが最低要件を満たしていないか、対応する言語を検出していません。」(Apple) |
言語の設定と、マイクの入力先。この2つは無料で直せて、しかも公式が名指ししている条件です。道具を替える前に、まずここを見てください。
そして「精度」という言葉が、実は複数のものを指していることは別に書きました。文字の正しさ、話者の正しさ、要約の正しさは、それぞれ別に確かめる必要があります。測り方は精度は3つあるに、話者の外れ方の実測は話者分離が外れる2つの壊れ方にまとめてあります。
種類は3つ——音声の入手経路で分かれる
AI議事録の製品は、音声をどこから手に入れるかで3種類に分かれます。
| 型 | 音声の入手 | 向いている場面 |
|---|---|---|
| ボット型 | Web会議に自動参加して受け取る | Zoom/Teams中心・チーム利用 |
| アプリ型 | スマートフォンやPCのマイクで録る | 対面の会議・個人 |
| 専用機型 | 専用のレコーダーで録る | 終日の録音・通話 |
Web会議は参加者ごとに音声が分かれて届くので、ボット型は話者の問題が最初からありません。対面はその通り道が無いので、アプリ型・専用機型が1本のマイクと格闘することになります。自分の会議がWeb中心か対面中心かで、まず型が決まります。型ごとの現況は対面の会議を録る道具は4つの形に分かれたにまとめてあります。製品ごとに並べた広い比較は議事録アプリの比較にあります。
3つの型を、実際に押すボタンで見比べる
上の表は音声の入手経路で分けたものです。ここでは同じ3つを、その場で何を押すか・どこに残るか・相手に何が伝わるかで並べ直します。導入の可否は、たいていこの3つのどれかで決まるからです。
まず、始め方。公式ヘルプに書かれている操作をそのまま並べます。
| 型 | 始めるときの操作 |
|---|---|
| Web会議に組み込み(Teams) | 会議コントロールの[その他のアクション]>[レコーディングと文字起こし]>[文字起こしの開始] |
| Web会議に組み込み(Meet) | 文字起こしを開始する。議事録が要るなら別に[メモの作成を開始]をクリック |
| 端末で録る(iPhoneの通話) | 通話中にメニューを開き「通話録音」をタップ |
| 端末で録る(iPhoneのメモ) | メモを開いて添付ボタンをタップし、「オーディオを録音」をタップ |
| ファイルを上げる(Word) | [ホーム]>[ディクテーション]>[トランスクリプト]で[オーディオのアップロード] |
Teamsで1つ注意があります。録画を始めると文字起こしも自動的に始まります。公式ヘルプには「会議を記録すると、文字起こしが自動的に開始されます。」とあり、文字起こしだけを単独で始めることはできますが、その逆はありません。「録画はしたが文字起こしはしていない」つもりの会議が、実は両方残っていることがあります。
次に、残る場所と、相手に伝わること。
| 型 | 残る場所 | 相手に伝わること |
|---|---|---|
| Teams(録画) | 通常の会議は開催者のOneDrive、チャネル会議はSharePoint | 記録を開始すると全参加者に自動で通知 |
| Meet | 主催者のGoogleドライブの「Google Meet」フォルダ | 録画の開始・停止で通知。手で文字起こしを始めると全員の画面右上にアイコン |
| iPhoneの通話 | メモアプリの「通話録音」フォルダ | 「オーディオ通知で両方の通話者に知らされます」 |
| Word | OneDriveの「トランスクリプトされたファイル」フォルダ | 上げたファイルの録り方しだい |
どの型も、黙って録る作りにはなっていません。Appleは手順の冒頭で「録音しても問題ないことを通話相手に確認してください。」と求めていますし、Googleは自動メモ生成について「使用していることを全員に知らせてください」と書いています。
向き不向きははっきりしています。Web会議に組み込みの型は、参加者の名前が最初から付くのが最大の利点です。向かないのは、他社に呼ばれる側の人です。Teamsでは「ゲストは会議を記録できません。フェデレーション ユーザーは通話を記録できますが、会議を記録することはできません。」と明記されていて、自分の手元に記録を残す道がありません。
端末で録る型は、相手の環境やライセンスに左右されないのが強みです。対面の会議と、他社のアカウントで開かれるWeb会議はここに落ちます。弱点は前に書いたとおりで、話者の名前は自動では付きません。
ファイルを上げる型は、すでに録ってあるものを起こす道です。Wordの場合、形式は「.wav、.mp4、.m4a、.mp3」の4つ、上限は月300分。そして「インターネットの速度によっては、トランスクリプトにオーディオ ファイルの長さくらいまでの時間がかかる場合があります。」とあるので、会議の直後に議事録が要る場面には向きません。
なお、外部のAI議事録サービスがWeb会議にボットとして参加する方式については、3社の公式ヘルプで許可・禁止を正面から扱ったページを今回は特定できませんでした。確認できたのは、上に挙げた「ゲスト・外部参加者は記録できない」という記録権限の話までです。ボットを入れられない会議でどうするかは別の記事にまとめました。
できないこと——公式に書いてあること、書いていないこと
「AIは固有名詞に弱い」「方言は苦手」という話はよく見かけます。ところがその裏付けを公式ヘルプに探すと、見つかりません。3社とも「こういう条件では精度が落ちる」を具体的に書いていないというのが、調べた範囲での結論です。
代わりに、公式が名指ししている制約はあります。実務で効くのはこちらのほうです。
| 困りごと | 公式に確認できたこと |
|---|---|
| 固有名詞・専門用語・方言 | 該当する記述は確認できませんでした |
| 複数人の同時発話 | 該当する記述は確認できませんでした |
| 言語が混ざる会議 | 「一度に 1 つの言語にのみ対応し、現在のところ、複数の言語で行われる会議には対応していません。」(Meetの自動メモ生成) |
| 対面で誰が話したか | 「話者を認識しない場合、オーディオは AI ノートの会議室に帰属します」(Teams Rooms) |
| 音の入り口 | 「マイク入力がヘッドセット マイクに設定されている場合は、対面会議での音声を拾えません。」(Word) |
つまり、精度が落ちる条件を各社が一覧にしてくれているわけではありません。自分の会議で1本試して確かめる以外に、事前に知る方法がないというのが正直なところです。
もう1つ、見落としやすいのが「音以外は残らない」ことです。Google Meetの文字起こしは「会議で話された言葉のみが含まれます。」とあり、チャットも画面の内容も入りません。録画についても「その他のウィンドウや通知は録画に保存されません。」と書かれています。
Teamsの記録はさらに具体的で、入らないものが列挙されています。ホワイトボードと注釈、共有メモ、アプリが共有するコンテンツ、PowerPoint Liveに埋め込まれた動画やアニメーション。議論の中心がホワイトボードだった会議は、記録を見返しても何も分かりません。
録音そのものが止まる条件もあります。iPhoneのボイスメモは「録音中でも、iPhoneでオーディオを再生しない限り、ほかのアプリを使用できます。」「そのアプリでオーディオの再生が始まると、ボイスメモの録音は停止します。」と公式にあります。Web会議の音を鳴らしながらボイスメモで録るという使い方は、この記述のとおりなら成立しません。画面収録にも「一部のアプリでは、そのコンテンツの録画が許可されていない場合があります。」という注記があります。
消えるものも整理しておきます。音声を消すと文字起こしも消える(Apple)。文字起こしを取らなかった会議は、終了時点で音声由来のデータもCopilotとのやり取りも失われる(Teams)。翻訳されたトランスクリプトは保存されず、元の言語のものだけが残る(Teams)。ライブキャプションはそもそも保存されません。
そして最後に、どの製品にもできないことがあります。言っていないことは記録できません。答えをはぐらかされた、その瞬間に場が固まった、決裁者が黙ったまま頷いた。会議でいちばん重い情報が音になっていないことは珍しくなく、これは性能では解決しません。議事録を読む人が「書いていないことがある」と知っているかどうかが、そのまま運用の質になります。
料金の相場観
2026年8月時点のざっくりした相場です。
- 無料枠:月60〜300分が相場。1時間の会議を週1本で使い切る量です
- 個人向け:月¥500〜5,000。文字起こしまでか、議事録までかで価格帯が分かれます
- 専用機:本体¥14,000〜31,000+多くは月額
- 法人向け:1人あたり月数千円〜
見た目の月額より、自分の月間録音時間が枠に収まるかで総額が決まります。
導入前に確かめる2つ
仕組み上、どの製品でも共通して確かめるべきことが2つあります。
音声がどこへ行くか。 2段の処理は多くの場合、外部のサーバーで動きます。つまり会議の音声が社外へ出ます。送信先が明記されているか、学習に使われないか。確かめ方は5つの質問にまとめました。
間違いを確かめる手段があるか。 90〜95%というのは、1時間に数百か所間違うということです。議事録の行から元の音声に戻れるか、話者が崩れたときに打ち直せるか。外れたあとの手が製品の実力です。
うちの製品(Recory)はアプリ型で、対面の会議に寄せて作っています。この記事の一般論がそのまま当てはまるので、できることとできないことも同じ構造で書いてあります。
うまくいかないとき
止まる場所はだいたい決まっています。原因が公式ヘルプに書かれているものだけを、症状と対処の対で並べます。ここに無い症状は、この記事の範囲では原因を特定できていません。まず、文字起こしが出ない側。
| 症状 | 公式に確認できる原因 | 見る場所 |
|---|---|---|
| iPhoneで文字起こしが表示されない | 「お使いのiPhoneが最低要件を満たしていないか、対応する言語を検出していません」 | 機種(メモとボイスメモの文字起こしはiPhone 12以降)と、端末の言語 |
| 端末の表示言語を英語にしている | メモの文字起こしは「デバイスの言語」が対応言語のときに使える | 設定>一般>言語と地域 |
| 通話の文字起こしが出ない | 電話・FaceTimeの通話をメモアプリで文字起こしするにはiOS 18.1以降 | 設定>一般>情報のバージョン |
| 通話録音のメニューが無い | 国や地域による制限がある。日本は利用できない国の列挙に含まれていない | 設定>アプリ>電話>通話録音(既定はオン) |
次に、要約が出ない側。1段目と2段目で条件が違うので、ここで詰まる人が多いところです。
| 症状 | 公式に確認できる原因 | 見る場所 |
|---|---|---|
| 「要約」が出ない | Apple Intelligenceの対象はiPhone 15 Proモデル、iPhone 16モデル以降 | 機種 |
| Apple Intelligenceがオンにできない | iOS 18.1以降・空き容量7GB・デバイスの言語とSiriの言語が同じ対応言語であること | 設定>一般>iPhoneストレージ、Siriの言語 |
| 会議後にCopilotが使えない | 会議中にライブ文字起こしをオンにしていなかった | 次の会議で先に[文字起こしの開始] |
| Meetの自動メモ生成が選べない | 対象のGoogle WorkspaceエディションまたはGoogle AIプランの登録が要る | 契約しているエディション |
最後に、録る側・上げる側。
| 症状 | 公式に確認できる原因 | 見る場所 |
|---|---|---|
| ボイスメモの録音が途中で止まる | 「そのアプリでオーディオの再生が始まると、ボイスメモの録音は停止します。」 | 録音中に音を鳴らすアプリを開いていないか |
| iPhoneでMeetの文字起こしを始められない | 「文字起こし機能は、パソコン、ノートパソコン、Android デバイスでのみご利用いただけます。」 | 端末を替えるか、別の型に切り替える |
| Wordがファイルを受け付けない | 対応形式は.wav / .mp4 / .m4a / .mp3。上限は月300分 | ファイルの拡張子と、その月の使用量 |
| ライブキャプションの文字起こしをコピーできない | 保存を「1分」にしているとコピー・スクリーンショット・画面収録ができない | 「1時間」に変更(通話開始時に全員へ音声アナウンスが流れます) |
どれにも当てはまらないときは、機種・OSのバージョン・ライセンス・言語設定の4つを紙に書き出して、公式ヘルプの条件と1つずつ突き合わせてください。AI議事録がうまく動かないときの原因は、ほとんどが精度ではなく条件です。
入れる順番——まず1人で1か月
ここまで見てきたとおり、動くかどうかは機種・OSのバージョン・ライセンス・言語設定で細かく分かれます。全社に配ってから条件を確かめると、問い合わせが全部こちらに来ます。先に1人で回して、条件を潰しきってから広げるほうが速いです。
- 標準機能で1本録ってみる。 iPhoneならボイスメモ(ユーティリティフォルダにあります)、Web会議ならTeamsやMeetの文字起こし。追加の契約も稟議も要らない範囲で、2段の処理が自分の会議でどう見えるかが分かります
- 自分の会議がどの型かを決める。 Web会議が中心なら組み込みの型、対面や他社主催の会議が中心なら端末で録る型。ここを決めないと、比較する候補が絞れません
- 1か月、自分の会議だけで回す。 数えるのは3つです。固有名詞がいくつ正しく出たか、話者ラベルの数が参加人数と合っているか、議事録の1行から音声の位置に戻れるか
- 相手への伝え方を先に決める。 標準機能はどれも通知が出る作りですが、外部のサービスは自分で伝えることになります。言い回しを1つ決めておくと、毎回悩まずに済みます
- 保存先と消し方を決めてから、隣の人に渡す。 どのフォルダに残るか、消すと何が一緒に消えるかは前に書いたとおりです
1か月のあいだに記録しておく項目も決めておきます。あとで「導入すべきか」を判断するとき、この4つがあれば話が早く済みます。
| 記録する項目 | なぜ要るか |
|---|---|
| 会議の本数と合計時間 | 料金プランの枠に収まるかが、これだけで決まります |
| 手直しにかかった時間 | 削減できた時間ではなく、増えた作業のほうを見ます |
| 直せなかった箇所 | 直せない種類の誤りがどれだけあるかが、その道具の限界です |
| 相手に断ったときの反応 | 社外の会議で使えるかは、ここで決まります |
向くのは、自分が議事録を書いている人です。書いている人なら手直しの手間と削減の効果を自分で比べられます。向かないのは、書いていない人が「部下の議事録作成を効率化する」目的で選ぶ場合です。手直しの重さは書く人にしか見えないので、選定の材料が手元に集まりません。
社内の規程づくりまで進めるなら、録音の扱いを先に決めておくほうが安全です。基準の作り方は会議を録音するときの社内基準に、断り方の文例は録音の同意にまとめました。
音声を預けるとき、一次情報で確かめられるのはここまで
「会議の音声を外部のサービスに渡してよいか」は、導入の最後に必ず出る質問です。ここは一次情報で確かめられる範囲がはっきりしているので、その線を引いておきます。
個人情報保護委員会のQ&A(Q7-53)は、クラウドサービスの利用が第三者提供や委託にあたるかについてこう書いています。「クラウドサービスの利用が、本人の同意が必要な第三者提供(法第27条第1項)又は委託(法第27条第5項第1号)に該当するかどうかは、保存している電子データに個人データが含まれているかどうかではなく、クラウドサービスを提供する事業者において個人データを取り扱うこととなっているのかどうかが判断の基準となります。」
分かれ目は、データに個人情報が入っているかではありません。その事業者が取り扱うことになっているかどうかです。会議の音声には参加者の名前も声も入っていますが、それ自体が結論を決めるわけではない、という順序になっています。
では「取り扱わない」と言えるのはどういう場合か。同じQ&Aに例示があります。「契約条項によって当該外部事業者がサーバに保存された個人データを取り扱わない旨が定められており、適切にアクセス制御を行っている場合等が考えられます。」つまり見るのは契約条項とアクセス制御の2点で、サービスの説明ページの雰囲気ではありません。
学習に使われるかどうかは、各社で書きぶりが違います。今回確認できたのはWordだけで、「トランスクリプトが完了すると、音声とトランスクリプトの結果は Microsoft のサービスによって保存されません。」と明記されています。Teams・Google Meet・Appleについては、今回の確認範囲では該当する記述にたどり着けませんでした。サービスごとに自分で当たる必要があります。
もう1つ、標準機能はどれも「録っていることが相手に伝わる」作りになっています。iPhoneの通話録音は開始時に双方へ音声通知が流れ、Appleは手順の冒頭で相手への確認を求めています。Teamsは記録の開始で全参加者に自動通知、Google Meetも録画の開始・停止で通知が出ます。iPhoneではマイクが使われているあいだ、画面右上にオレンジ色のインジケータが出ます。
一次情報で言えるのはここまでです。録音してよいかどうかの結論は、この記事では出せません。社内規程や相手先の会社の規則は個人情報保護法とは別に効きますし、業種によっては固有の規制もあります。個別の判断は弁護士にご確認ください。確かめる観点の整理はAI議事録のセキュリティを確かめる5つの質問に書きました。
用語集——比較記事に出てくる言葉
各社のヘルプで言い方が揃っていないので、比較記事を読むときに混乱しやすいところです。公式に定義が書かれているものと、そうでないものを分けて並べます。
| 言葉 | この記事での意味 | 公式の定義 |
|---|---|---|
| 文字起こし | 音声を文字にする処理。1段目 | 定義の記載は確認できず |
| トランスクリプト | 文字起こしの結果そのもの。Microsoftはこの語を使う | 定義の記載は確認できず |
| 議事録・要約 | 文字起こしを読んで整理した文書。2段目 | 定義の記載は確認できず |
| 話者分離 | 発言を人ごとに割り振る処理 | 定義の記載は確認できず |
用語の定義が公式に無いというのは、意外に思われるかもしれません。ただ、動作のほうは書かれています。Appleは「それぞれの文の話者が識別されます」、Wordは「異なる話者を識別して分離し、"Speaker 1"、"Speaker 2" などのラベルを付けます」。定義ではなく、出てくるものを読むのが確実です。
次の3つは、公式ヘルプに操作や条件が書かれている言葉です。
| 言葉 | 公式に確認できること |
|---|---|
| ライブ文字起こし | 会議中にリアルタイムで表示される文字起こし。Teamsでは各話者の名前とタイムスタンプが入る |
| キャプション | 会議中の字幕。Teamsではキャプションは保存されず、トランスクリプトだけが残る |
| タイムスタンプ | 発言の時刻。Wordではタイムスタンプを選ぶとその位置の音声が再生される |
タイムスタンプは地味ですが、実務では効きます。iPhoneの通話の文字起こしでも「特定の位置からオーディオを再生する: 聞きたいテキストを選択します。」と公式にあり、疑わしい行を音で確かめる導線が標準機能に入っています。この導線があるかどうかで、間違いに気づけるかが変わります。
録音の設定まわりの言葉も、ボイスメモのページで確認できます。背景音の扱いはコントロールセンターの「ボイスメモ」から切り替える形で、静かな声だけを残したいなら「声を分離」、場の音ごと残したいなら「ワイドスペクトル」。収録モード(モノ/ステレオ/空間オーディオ)は設定>アプリ>ボイスメモ>収録モードで選びます。
最後に「ボット」。Web会議に参加者として入り、音声を受け取って文字起こしと議事録を作る仕組みを指す言い方です。これも公式の定義は確認できませんでした。会議に人以外の参加者が増えるので、相手先の規則で断られることがあります。
そして「オンデバイス」。端末の中だけで処理し、音声を外に出さない方式を指す言い方です。これも公式の定義は確認できませんでしたが、実務では音声がどこへ行くかの質問に置き換えたほうが確実です。定義を聞くのではなく、送信先が明記されているかを見てください。
自分で確かめるときの入口
この記事の記述は、次の場所で自分で確認できます。まとめサイトではなく、ここを直接見てください。条件はバージョンごとに変わるので、他人がまとめた時点の情報より、いま公式に書いてあることのほうが正確です。
| 調べたいこと | 見る場所 |
|---|---|
| iPhoneの録音・文字起こし・要約 | AppleのiPhoneユーザガイド(通話録音/メモ/ボイスメモの各ページ) |
| Apple Intelligenceの対応機種と条件 | Appleのサポート記事「Apple Intelligenceを入手する方法」 |
| Teamsの文字起こしと記録 | Microsoftサポートのライブ文字起こし/会議の記録の各ページ |
| Wordの文字起こし | Microsoftサポート「レコーディングの文字起こし」 |
| Google Meetの文字起こしと自動メモ生成 | Google Meetヘルプの該当ページ |
| 個人データとクラウドの扱い | 個人情報保護委員会のFAQ(Q7-53) |
今回、公式に記載を確認できなかったものも書き残しておきます。文字起こしの精度を示す数値、固有名詞や方言で精度が落ちるという定量的な裏付け、iPhoneのボイスメモとメモの文字起こしが話者を分けるかどうか、Wordで1ファイルあたりに上げられるサイズの上限。これらを断言している記事を見かけたら、出典を確かめてください。
うちの製品(Recory)は、この記事でいう「端末で録る型」にあたります。同じ物差しで測れるように、できることとできないことを分けて書いてあります。
仕様は2026年9月2日時点の公式サイトの記述に基づきます。OSのバージョンで名前や場所が変わるので、お手元でご確認ください。
よくある質問
AI議事録とは何ですか
会議の音声から、文字起こしと議事録を自動で作る仕組みの総称です。中では「音声を文字にする処理(音声認識)」と「文字を議事録に整理する処理(生成AI)」という2つの別の技術が順に動いています。この2段を理解すると、製品ごとの得意不得意が読めるようになります。
AI議事録の精度はどのくらいですか
文字起こしの精度は日本語で実勢90〜95%です。ただし実務で困るのは文字の間違いより、誰の発言かの取り違えと、要約が事実を曲げることのほうで、この2つには公表できる数字がありません。精度は1つの数字ではなく3つに分けて見る必要があります。
AI議事録には何ができませんか
言っていないことは拾えません。会議で答えをはぐらかされた、空気が張り詰めた、といった「音にならない情報」は記録できません。また固有名詞の間違いと話者の取り違えは、どの製品でも一定の割合で起きます。確かめる手段があるかが製品の分かれ目です。
AIで文字起こしする方法はありますか
3つあります。端末の標準機能を使う、文字起こしサービスに音声を渡す、手元でモデルを動かす、です。音声を社外に出せるかどうかで、選べる範囲が変わります。
AI議事録とは何ですか
会議の音声から文字起こしと議事録を自動で作る仕組みの総称です。中では「音声を文字にする処理」と「文字を議事録に整理する処理」という2つの別の工程が順に動いています。各社の画面でも別々のボタンとして置かれていて、たとえばTeamsでは会議後にCopilotを使うために会議中のライブ文字起こしをオンにしておく必要があると公式に案内されています。1段目を取らなかった会議は2段目も動きません。
文字起こしと議事録は何が違うのですか
工程が違います。文字起こしは音声をそのまま文字にしたもので、議事録はその文字を読んで決定事項や宿題に整理したものです。文字起こしまでしかない道具もあります。Wordの文字起こしがその例で、アップロードした音声は月300分まで、対応形式は.wav / .mp4 / .m4a / .mp3と公式に決まっています。
AI議事録の精度はどのくらいですか
Apple・Microsoft・Googleの公式ヘルプを確認した範囲では、精度をパーセントで示した記載は見つけられませんでした。あるのは但し書きだけで、Appleは「文字起こしを信頼する前に、精度を確認してください。会話を完全に再現できていない可能性があります。」、Googleは会議の要約について「不完全または不正確であったり、生成されなかったりする場合があります」と書いています。数字を見たときは、何を数えたのか・どんな音声で測ったのかを確かめてください。
話者分離とは何ですか
発言を人ごとに割り振る処理を指す言い方です。ただしこの用語の定義は3社の日本語ヘルプでは確認できませんでした。確認できるのは動作の記述で、iPhoneの通話録音は「それぞれの文の話者が識別されます」、Wordは「"Speaker 1"、"Speaker 2" などのラベルを付けます」と書かれています。名前が出るか番号止まりかは製品によって違います。
対面の会議でも誰が話したか分かりますか
自動では付かないことがあります。Web会議は参加者のアカウントと音声が結び付いているため名前が最初から入りますが、対面は音から推定することになります。Microsoftの会議室向け機器でも、室内の個人を名前で識別するには事前に音声プロファイルを登録してオプトインする必要があり、登録が無ければ発言は個人ではなく会議室に帰属すると公式に書かれています。
iPhoneだけでAI議事録は作れますか
標準機能の範囲では、録音と文字起こしまでと、要約とで条件が違います。メモとボイスメモの文字起こしはiPhone 12以降で日本語に対応し、通話を録音してメモアプリで文字起こしを見るにはiOS 18.1以降が必要です。要約にあたるApple Intelligenceは対象がiPhone 15 Proモデル、iPhone 16モデル以降で、iOS 18.1以降・空き容量7GB・デバイスとSiriの言語が同じ対応言語であることが条件です。
文字起こしが表示されないのはなぜですか
Appleは理由を2つ挙げています。「お使いのiPhoneが最低要件を満たしていないか、対応する言語を検出していません」という記述です。機種の条件(メモとボイスメモの文字起こしはiPhone 12以降)と、端末の言語設定が対応言語になっているかを順に確認してください。表示言語を英語にしている場合はここで止まります。
会議を録音していることは相手に伝える必要がありますか
各社の標準機能は、伝わる作りになっています。iPhoneの通話録音は開始時に双方へ音声通知が流れ、Appleは手順の冒頭で「録音しても問題ないことを通話相手に確認してください。」と求めています。Teamsは記録の開始で全参加者に自動通知、Google Meetも録画の開始・停止で通知が出ます。ただし録音してよいかどうかの結論はここでは出せません。社内規程や相手先の規則は別に効くので、個別の判断は弁護士にご確認ください。
AI議事録はどこから導入すればよいですか
まず1人で1か月試すのが確実です。動くかどうかは機種・OSのバージョン・ライセンス・言語設定で細かく分かれるので、配ってから条件を確かめると問い合わせが集中します。標準機能で1本録り、自分の会議がWeb中心か対面中心かを決め、固有名詞の正しさ・話者ラベルの数・議事録から音声に戻れるかの3つを1か月数えてから広げてください。
「精度98%」は何の数字か —— AI議事録の精度は3つある
AI議事録のセキュリティを、自分で確かめる5つの質問
対面の会議を録る道具は、この1年で4つの形に分かれた