Recory ノート ダウンロード
選び方と比較

ブラウザだけで文字起こしする——インストールできないPCでの選択肢と限界

会社のPCにソフトを入れられない、という制約から探している人向けです。ブラウザで完結する方法には共通の弱点が4つあります。タブを離れると止まる、長時間に弱い、話者が分かれない、音声がどこへ行くか分かりにくい。そこを踏まえた使い分けを整理しました。

「ブラウザだけで文字起こしをしたい」と探している人の事情は、たいてい同じです。会社のPCにソフトを入れられない、という制約です。管理者の権限が無い、申請が要る、そもそも許可されていない。この条件で使える手段は限られます。

この記事の内容(17項目)
  1. ブラウザ型には2種類あります
  2. ブラウザの中で何が起きているか
  3. 弱点1——タブを離れると止まります
  4. 「止まる」について、公式に書かれていること
  5. 弱点2——長時間に弱い
  6. Googleドキュメントの音声入力——手順と、書かれていないこと
  7. 弱点3——話者が分かれません
  8. 話者を分けたいなら、ブラウザの中では完結しません
  9. 弱点4——音声がどこへ行くか、見た目では分かりません
  10. 会社のPCで使うときに確認すること
  11. 「録音サイト」を探している人へ
  12. ブラウザで録音するときの落とし穴
  13. どう使い分けるか
  14. Web会議に「ブラウザで参加」したときの文字起こし
  15. ブラウザが対応していなくても、OSの音声入力なら入る
  16. 画面で読むだけなら、ライブキャプションがある
  17. うまくいかないとき

結論から書くと、ブラウザだけで完結させることはできます。ただし共通する弱点が4つあり、そこを知らずに会議で使うと記録を失います。順に見ていきます。

ブラウザ型には2種類あります

同じ「ブラウザで文字起こし」でも、中でやっていることが違います。この違いが、弱点の出方を分けます。

その場で認識する型ファイルを上げる型
使い方ブラウザで開いたまま話す・音を流す録音済みのファイルをアップロードする
会議中に使うか会議中に動かし続ける会議のあとで処理する
途中で止まる問題起きる起きない
長い会議苦手上限があることが多い
音声の行き先方式によるサーバーへ送る

会議で使うなら、ファイルを上げる型のほうが安全です。録音そのものは端末の標準アプリなど確実な手段で取り、あとからファイルを渡す。この組み立てなら、会議中に文字起こしが止まっていても記録は残ります。

その場で認識する型は、その場で文字が出るのが利点です。ただしそれは記録が二重に取れていないということでもあります。認識が止まった時点で、そのぶんの会議は残りません。

会議中にリアルタイムで見たいその場で認識する型止まったら記録が消える記録を確実に残したい録音は別に取る止まっても音声は残る
ブラウザで文字起こしをするときの、最初の分かれ道。

ブラウザの中で何が起きているか

ブラウザで文字起こしができるのは、標準の仕組みが2つ入っているからです。ひとつはマイクから音を受け取る仕組み、もうひとつは受け取った音を文字にする音声認識の仕組みです。前者はどのブラウザにもありますが、後者は振る舞いがブラウザごとに違います。

まず音を受け取るところから。MDNの説明では、この仕組みは安全なコンテキスト(HTTPS、localhost、file:///)でのみ利用でき、常にユーザーの許可を得なければならないとされています。許可を拒否すると NotAllowedError で失敗し、ページはマイクを開けません。httpsで配信されていないページでは、そもそも録音を始められません。

問題は次の段です。音を文字にするところで、音声がどこへ行くかが決まります。MDNの英語版には、音声認識は通常オンラインのサービスで行われる、という説明があります。録音がサーバーへ送られて処理され、その結果がブラウザへ返る、という流れです。

マイクを開くブラウザの許可ページの指定端末内か外か認識する場所端末内かサーバー文字が返るページへ渡る
ブラウザで話した声が通る道。文字になる場所は、いちばん上では決まらない。

サイト側は、端末の中で処理するよう指定することもできます。MDNの processLocally の項によれば、この指定を false(既定値)にしたときは、ローカルで処理するか遠隔で処理するかをブラウザ側が選べます。つまり既定では、どちらになるかが公式には決まっていません。

端末の中で処理できるようになったのは最近です。Googleの告知では、Chrome 139でWeb Speech APIに端末内の音声認識が加わり、サイトは音声も文字起こし結果も第三者のサービスへ送られないことを保証できるようになった、と書かれています。裏を返せば、サイトがその指定をしていなければ保証はありません。

端末内での認識には、認識させたい言語ごとに1回だけ言語パックのダウンロードが要ります。入れたあとはオフラインでも動きます。逆に、パックが入っていない状態で端末内処理を指定すると、開始の呼び出しが language-not-supported というエラーで失敗します。

利用者の側から見えるかどうかを、段ごとに分けておきます。ここが「見た目では分からない」の中身です。

通る段決めているもの画面で分かるか
マイクを開くブラウザの許可設定分かる(許可のダイアログが出る)
音を文字にするページ側の指定とブラウザ分からない
文字を受け取るページ分かる(画面に出る)

Safariは事情が違います。WebKitの公式ブログによれば、Safari 14.1(macOS Big Sur、iOS 14.5、iPadOS 14.5)でSiriと同じ音声エンジンによる音声認識に対応し、50を超える言語・方言を扱えるようになりました。ただし利用するにはMacのシステム環境設定、またはiOS / iPadOSの設定でSiriを有効にしておく必要があり、Siriを切っているとこの仕組みそのものが使えません。

Safariで認識した音声がAppleのサーバーへ送られるかどうかは、公式に記載を確認できませんでした。WebKitのブログが書いているのは「Siriと同じ音声エンジン」「Siriを有効にする必要がある」までです。iPhoneのSafariで使うときの機種の下限も、公式ページでは確認できず、確かめられたのはOSのバージョンだけでした。

弱点1——タブを離れると止まります

ブラウザは、表示していないタブの処理を抑えるように作られています。電池と処理能力を節約するための仕組みで、普段は利点として働きます。文字起こしを動かしているときだけは、これが敵になります。

実際に起きるのはこういう流れです。会議が始まって文字起こしのタブを開く。話が資料の話になったので、別のタブで資料を開く。会議が終わってタブに戻ると、資料を開いたところで認識が止まっている。

対策はいくつかありますが、どれも完全ではありません。文字起こしのタブを別のウィンドウにして常に見える場所へ置く、資料は別の端末で開く、といった運用でしのぐことになります。根本的には、会議中にブラウザを動かし続ける方式そのものの弱点です。

「止まる」について、公式に書かれていること

「裏のタブに回すと文字起こしが止まる」という説明は広く出回っています。ただしChromeの公式資料を読むと、条件はもう少し細かい。マイクを掴んでいるページは、抑制の対象から外れます。

Chromeの開発者向けブログには、省エネモードが有効なときのフリーズについて説明があります。Chrome 133以降、グループ内のすべてのページが5分以上非表示かつミュートで、CPU使用率が高いと判定されたバックグラウンドタブはフリーズされ、イベントハンドラもタイマーもPromiseの解決も止まります。フリーズは、タブがメモリからアンロードされる破棄とは別物だとも書かれています。

同じ記事に例外が挙がっています。マイク・カメラ・画面やウィンドウやタブのキャプチャ・RTCPeerConnectionを使って音声やビデオ会議の機能を提供しているページは、フリーズの対象外です。ほかにWeb USBなどで外部機器を制御しているページ、Web LockやIndexedDBの接続を持つページも外れます。マイクを開いたままの文字起こしのページは、この1つ目に当てはまります。

タイマーの抑制にも段があります。Chrome 88の解説では、ページが表示されている、または直近30秒に音を出していれば抑制は最小限にとどまります。5分を超えて隠れていて、連鎖するタイマーが5回以上あり、30秒以上無音のときに「集中的な抑制」に入り、その状態のタイマーはブラウザが1分に1回しか確認しません。

マイクを掴んでいる抑制の対象外止まらない音が鳴っている抑制は最小限続くどちらも無い強い抑制取りこぼす
裏に回ったタブがどう扱われるかは、マイクと音で分かれる。

まとめると、公式に書かれているのはここまでです。

状態公式に書かれている扱い
マイクを使っているフリーズの対象外
表示されている、または直近30秒に音が出た抑制は最小限
5分超の非表示 + 30秒以上の無音タイマーの確認は1分に1回
ページが破棄されたタスクもJavaScriptも一切動かない

実務で効くのは、止まることより始められないことのほうです。Chromeの公式ヘルプは、マイクを許可したサイトについて「別の Chrome タブまたは別のアプリを使用している場合、サイトでは録音・録画を開始することはできません」と書いています。開始の操作をしてからすぐ別のタブへ移ると、そもそも録れていない場合があります。

なお、Googleドキュメントの音声入力が別のタブやウィンドウに切り替えると止まる、という趣旨の記載は、日本語版・英語版のどちらのヘルプにも確認できませんでした。「止まる」と書いている記事は多いのですが、公式の裏は取れていません。

やること根拠になる公式の記載
開始はそのタブを前面にしてから別タブや別アプリの使用中は録音を開始できない
文字起こしのタブを固定する固定タブはメモリセーバーの対象外
資料は別ウィンドウか別の端末で開く非表示かつ無音の時間を作らない
途中で再読み込みしない破棄された状態ではJavaScriptが動かない

弱点2——長時間に弱い

1時間を超える会議では、途中で止まる確率が上がります。しかも止まったことに気づきにくいというのが厄介なところで、画面には途中までの文字が残っているので、一見すると動いているように見えます。

ファイルを上げる型にも別の形で上限があります。無料の枠では、1ファイルの長さや月あたりの合計時間に線が引かれているのが普通です。どこに線があるかはサービスごとに違うので、無料でどこまでできるかにまとめた見方で確かめてください。

長い会議を分割して渡すという手もありますが、分割すると区間をまたいだ話者の対応づけが崩れます。同じ人が前半では「話者A」、後半では「話者C」になる形です。長い会議を分けて処理するときの注意にまとめてあります。

Googleドキュメントの音声入力——手順と、書かれていないこと

ブラウザだけで文字にする方法として、いちばん手が届きやすいのがこれです。インストールも追加の登録も要りません。公式ヘルプに載っている手順は次のとおりです。

  1. Googleドキュメントを開き、[ツール] → [音声入力] の順にクリックする。マイクのボックスが表示される
  2. マイクをクリックしてから話す
  3. 話し終えたら、もう一度マイクをクリックして止める
ツールを開く音声入力を選ぶマイクを押す話し終えたらもう一度押す
公式ヘルプに載っている操作を、順に並べたもの。

Googleスライドは経路が違います。[ツール] → [スピーカー ノートを音声入力] で、スピーカーノートに入ります。使う前提として、パソコンのマイクがオンになっており正常に動作している必要がある、と公式に書かれています。設定の場所も案内されていて、Macは「システム設定」、Windowsは「コントロール パネル」です。

条件は公式ヘルプの記載どおりに並べます。ここを読み違えると、使えないブラウザで試して「壊れている」と判断することになります。

項目公式ヘルプの記載
対応ブラウザChrome / Edge / Safari の最新バージョン
対応言語100以上。日本語を含む
音声コマンド英語のみ。アカウントとドキュメントの両方の言語を英語に
句読点一部の言語では使用できない場合がある
連続で使える長さ記載を確認できなかった

Firefoxは一覧に挙がっていません。音声コマンドというのは「句読点」「改行」のような操作を声で行う機能で、これは英語専用です。日本語で使うぶんには、文字入力と句読点までと考えてください。スライドのスピーカーノートでは音声コマンドは使えない、という注記もあります。

音声の行き先について、公式ヘルプははっきり書いています。音声入力をオンにすると音声入力サービスを制御するのはウェブブラウザで、ブラウザが音声の処理方法を特定してGoogleドキュメントまたはGoogleスライドにテキストを送る、という説明です。つまり音声がどこで処理されるかは、Googleドキュメントではなく使っているブラウザ側で決まります。

会社のアカウントでは、機能そのものが無いことがあります。組織でこの機能が有効になっていない場合は管理者によって無効にされている可能性がある、と公式ヘルプに書かれています。メニューに [音声入力] が見当たらないときは、この線を先に疑ってください。

長時間については、記載を確認できませんでした。1回に連続して認識できる長さの上限も、別のタブへ切り替えたときの挙動も、公式ヘルプには見つかりません。「上限が書かれていない」ことと「上限が無い」ことは別なので、1時間の会議を通しで任せる前に短い音声で試すのが安全です。

弱点3——話者が分かれません

ブラウザの音声認識をそのまま使う方式では、話者は基本的に分かれません。出てくるのは、誰が話したかの区別が無い一続きの文章です。

議事録として使う場合、ここが実務で効きます。決まったことは書けても、誰がやるかが書けません。アクションアイテムの担当が空欄になるか、あとから思い出して埋めることになります。

ファイルを上げる型には話者分離に対応するものもありますが、無料の範囲では対象外になっていることが多いという傾向があります。誰が言ったかが要る会議では、そこを最初に確認してください。分かれなかった場合の対処は別の記事にまとめました。

話者を分けたいなら、ブラウザの中では完結しません

「Speaker 1」「Speaker 2」のようなラベルを自動で付ける公式の機能はあります。Microsoft 365のWordにあるトランスクリプトです。ただしブラウザ版のWordでは、一般の法人・個人の契約では使えません。

公式ページに提供範囲がはっきり書かれています。この機能は商用テナントではWindows上のWord for Microsoft 365でのみ利用でき、政府機関テナントについてのみWord for the web(ブラウザ版)での文字起こしが提供される、という書き方です。「ブラウザだけで」を条件にしている人にとっては、ここで選択肢から外れます。

条件は並べておきます。Windowsのデスクトップ版Wordが使える環境なら、この表がそのまま効きます。

項目公式の記載
アップロードの上限月300分(Microsoft Copilotライセンスは月30,000分)
対応形式.wav / .mp4 / .m4a / .mp3
話者話者ごとに区切り「Speaker 1」「Speaker 2」とラベルを付ける
保存先OneDriveの「トランスクリプトされたファイル」フォルダー
所要時間回線速度による。音声の長さと同じくらいかかることがある
1ファイルの上限記載を確認できなかった

最後の行を補足します。フォーラムの投稿には具体的な数字が書かれていることがありますが、公式のサポートページにサイズの記載はありません。上限を前提にした運用は組まないでください。

ブラウザ版のWordで使えるのは、ディクテーション(マイクに向かって話す型)のほうです。[ホーム] タブのボタンから始めます。マイクと安定したインターネット接続、そしてアクティブなMicrosoft 365サブスクリプションでのサインインが要ると公式に書かれていて、無料のアカウントだけでは動きません。

歯車アイコンから変えられるのは4つです。「音声言語」「マイク」「自動句読点を有効にする」「機密フレーズをフィルター処理する」。日本語は対応言語に入っています。ただしこれは話す人の声を文字にする機能で、話者を分ける機能ではありません。

ファイルを上げる型の利点も、公式の記載で確かめられます。Wordのトランスクリプトのページは、処理中に別の作業をしたり、ブラウザのタブやアプリを切り替えて後で戻ってきてよい、と明記しています。できたトランスクリプトは文書に紐づいて保存され、ウィンドウを閉じて開き直しても、文書を閉じて開き直しても残ります。

その場で認識する型との差は、この一点に出ます。処理をサーバー側が持っているものは、こちらが画面を見ていなくても進みます。先に書いたとおりこの機能自体はブラウザ版では使えませんが、ファイルを上げる型を選ぶときの判断材料にはなります。

弱点4——音声がどこへ行くか、見た目では分かりません

ここがいちばん大事な点なので、最後に書きます。ブラウザで動く文字起こしには、ブラウザの中だけで処理するものと、音声をサーバーへ送って処理するものがあります。画面を見ただけでは区別がつきません。

会社のPCにソフトを入れられない、という制約は、多くの場合情報の持ち出しを制限するために設けられています。ところがブラウザで開いたページに音声を渡すことは、その制限の外側にあることがあります。ソフトのインストールは止められているのに、音声を社外へ送るのは止まっていない、という状態です。確認すべきなのは次の3つです。

確かめることどこを見るか
音声がサーバーへ送られるかプライバシーポリシー、または「オフラインで動作」の記載
送られた音声が学習に使われるか利用規約の該当箇所
データがいつ消えるか保存期間の記載

記載が見つからない場合は、社外秘の会議には使わないという判断が安全です。この判断の考え方はAI議事録のセキュリティを自分で見るに、より詳しく書いています。

通信させたくない場合は、ブラウザではなく端末内で完結する手段を探すことになります。オフラインで文字起こしをする方法にまとめてありますが、選択肢は多くありません。

会社のPCで使うときに確認すること

社内の規程に照らす前に、手元で確かめられることがあります。Chromeでどのサイトにマイクを渡したかは、設定の画面で一覧できます。

初回にマイクを求められたときの選択肢は3つです。「サイトへのアクセス時のみ許可する」「今回のみ許可」「許可しない」。毎回聞かれてもかまわないなら「今回のみ許可」が安全側で、この場合は次回もう一度確認されます。

あとから変える経路も公式に案内されています。Chrome右上のその他アイコン → [設定] → [プライバシーとセキュリティ] → [サイトの設定] → [権限] → [マイク]。同じ画面で既定の入力デバイスも選べます。一度出した許可を取り消すときは、この画面で該当サイトの右にある削除アイコンを選びます。

職場のPCでは、そもそも自分で変えられないことがあります。職場や学校でChromeを使用している場合、ネットワーク管理者がカメラとマイクの設定を行っていることがあり、そのため設定を変更できない場合がある、と公式ヘルプに書かれています。許可しないとサイトによっては利用できなくなる場合がある(ビデオ会議に参加できなくなるなど)という注記も同じページにあります。

次に、社外へ音声を出してよいかの判断です。ここは個人情報保護委員会のQ&Aが出発点になります。クラウドサービスの利用が第三者提供にあたるかについて、判断の基準は「保存している電子データに個人データが含まれているかどうかではなく、クラウドサービスを提供する事業者において個人データを取り扱うこととなっているのかどうか」だとされています。

「取り扱わないこととなっている場合」として同Q&Aが挙げるのは、契約条項によって当該外部事業者がサーバに保存された個人データを取り扱わない旨が定められており、かつ適切にアクセス制御を行っている場合です。利用規約に目を通しただけでは、この条件を満たしたことにはなりません。

確かめることどこで確かめるか
音声が端末の外へ出るかサービスの説明と、ブラウザの権限の画面
取り扱わない旨が契約条項にあるか利用規約・データの取り扱いに関する条項
アクセス制御がされているか同上、またはサービス提供元への確認
社内で許可されているか情報システム部門・社内規程

これは法的な結論ではありません。社内規程や相手先の会社の規則は、法令とは別に効きます。個別の判断は弁護士にご確認ください。

「録音サイト」を探している人へ

録音サイト は月3,600回ほど打たれています。文字起こしではなく、録音そのものをブラウザでやりたいという探し方です。

できます。ブラウザにはマイクから音を録る仕組みが標準で入っていて、それを使った録音サイトがいくつもあります。インストールも登録も要りません。

ただし、会議の記録には向きません。理由はこの記事で挙げた弱点とほぼ同じです。

ブラウザで録る端末の標準機能で録る
準備サイトを開くだけアプリを開くだけ
途中で消えるかタブを閉じる・再読み込みで消える消えない。自動で保存される
保存ダウンロードの操作が要る自動
長時間苦手2時間程度なら問題ない

いちばん効くのは2行目です。1時間録ったあとに操作を1つ間違えると、全部消えます。端末の録音アプリは録った時点で保存されているので、この事故が起きません。

ブラウザで録るのが向くのは、その端末に録音アプリが無いときだけです。会社の共有パソコンで、ソフトを入れられない、といった場面。それ以外は端末に最初から入っている録音機能のほうが安全です。

ブラウザで録音するときの落とし穴

ブラウザで音を録る仕組みそのものは標準です。MDNのMediaStream Recording APIの説明では、録れた音はメディアデータを含むBlobとして渡されます。ファイルとして残すには、そのBlobを結合してダウンロードさせる操作が別に要ります。

マイクを許可ページが録るメモリに貯まる保存を押す
ブラウザの録音は、最後の一手を踏むまでファイルになっていない。

ここが端末の録音アプリとの決定的な違いです。端末のアプリは録った時点で保存されますが、ブラウザで録っているあいだはページのメモリの上にあるだけです。保存を押すまでは、まだファイルが1つも存在していません。

「タブを閉じると消える」と断言している記事は多いのですが、その挙動そのものを書いた公式の記述は、Apple・Microsoft・Googleのヘルプでは確認できませんでした。確認できたのは次の2点です。

  • Chromeのメモリセーバーは使っていないタブを無効にする機能で、アクティブでないタブにアクセスすると自動的に再読み込みされる
  • ページが「破棄」された状態では、タスクもイベントコールバックもJavaScriptも一切動かない

どちらも「録音の途中でページが作り直される道がある」ことを示しています。断定はしませんが、保存の操作を最後まで残す作りが危ういことは、この2点だけでも十分に言えます。

回避に使える記載もあります。Chromeの公式ヘルプは、タブを非アクティブにできない条件を列挙していて、そこに固定タブが入っています。ほかにアクティブな音声や動画(再生または通話)、画面共有、ページ通知、アクティブなダウンロード、一部記入済みのフォーム、接続済みのデバイス(USBまたはBluetooth)が挙がっています。

やること効く理由
録音中のタブを固定する固定タブは非アクティブにできない条件に入っている
短く区切って、こまめに保存する失う範囲が最後の区間だけで済む
録音中はそのタブを閉じない・再読み込みしない破棄されるとJavaScriptが動かない

会議の記録に使うなら、この3つを守っても端末の録音アプリより手数が多いままです。ブラウザで録るのが向くのは、その端末に録音アプリが無いときだけ、という結論は変わりません。

どう使い分けるか

弱点を4つ並べましたが、使える場面はあります。短い打ち合わせの控え、その場で内容を確認したいとき、社外秘ではない会議。この範囲なら、インストール不要という利点がそのまま効きます。一方で、次のいずれかに当てはまるなら、ブラウザだけで済ませないほうが安全です。

  • 1時間を超える会議。途中で止まる確率が上がり、気づきにくい
  • 誰が言ったかを残す必要がある。話者が分かれません
  • 社外秘の情報を扱う。音声の行き先が確認できるまで使わない
  • 記録を資産として貯めたい。あとから探せる形で残る作りになっていません

この場合の現実的な組み立ては、録音だけは確実な手段で取っておくことです。端末の標準の録音アプリで録っておけば、文字起こしの手段はあとから選び直せます。逆に録音そのものを失うと、取り返しがつきません。


この記事はブラウザで動く文字起こし全般に共通する性質について書いています。個別のサービスの仕様は変わるので、利用前にご自身で確認してください。

Web会議に「ブラウザで参加」したときの文字起こし

会議ツールの側に文字起こしが付いていることを期待して探している人もいます。結論から書くと、ブラウザから参加している場合は選択肢が狭まります。

Teamsのライブ文字起こしは、公式に「ライブ文字起こしは、デスクトップ用 Teams でのみ使用できます」と書かれています。モバイルアプリが対応しているのは会議終了後のトランスクリプトの閲覧までです。ブラウザ版を名指しした記述は確認できませんでしたが、デスクトップ版のみという条件はそのまま効きます。

始め方と取り出し方を書いておきます。会議中は [その他のアクション] → [レコーディングと文字起こし] → [文字起こしの開始]、止めるときは同じ経路で [文字起こしの停止] です。会議中に停止と再開ができるのは、会議の開催者・共同開催者・発表者です。

あとから取り出すときは、チャットから過去の会議を開き [まとめ] → [トランスクリプト] で、ドロップダウンから .docx か .vtt を選びます。保存先は主催者のOneDrive for Businessで、既定では会議の開催者と共同開催者がダウンロードできます。電話をかけて参加した人はトランスクリプトを表示できません。対応言語には「日本語 (日本)」があります。

Google Meetも似た形です。文字起こしは右下の会議ツールアイコン → 文字起こしアイコン → [文字起こしを開始] で始め、ポップアップで [開始] を押します。ただし対応環境はパソコン・ノートパソコン・Androidデバイスのみで、iPhoneやiPadのMeetからは開始できません。

項目Google Meetの文字起こし
必要な契約有料エディション限定(Business Standard など)
保存先主催者のGoogleドライブの「Google Meet」フォルダ
対応言語8言語。日本語を含む
参加者への表示全員の画面右上に文字起こしアイコンが出る

容量にも条件があります。文字起こしを記録できるのは、Workspace組織のGoogleドライブと会議の主催者のドライブの両方に十分な容量がある場合だけだと書かれています。主催者向けの管理機能がオンのときは、主催者と共同主催者だけが有効にできます。

黙って記録することはできない作りになっています。Meetは参加者全員の画面に文字起こしアイコンが出ますし、Teamsも文字起こしを始めるとすべての参加者に通知が出ます。録る側が伏せておく余地は、どちらにもありません。

字幕(自動字幕起こし)のほうは条件が違います。公式ヘルプは、字幕は自動字幕起こしをオンにしたユーザーのみに表示される、と書いています。経路は [その他アイコン] → [設定アイコン] → [字幕アイコン] で、日本語に対応し、[字幕を録画] を選べば録画に埋め込めます。無料のGoogleアカウントで使えるかどうかは、公式に明記を確認できませんでした。

ブラウザが対応していなくても、OSの音声入力なら入る

サイト側が音声認識に対応していなくても、テキスト欄に文字を入れる手はあります。OSに付いている音声入力です。ブラウザ上の入力欄でもそのまま使えるので、サイトの対応状況に左右されません。

Windowsは、ハードウェアキーボードでWindowsロゴキーを押しながらHキーを押すと起動します。公式に挙がっている前提は3つで、インターネットに接続し、マイクを動作させ、テキストボックスにカーソルを置くことです。オフラインでは使えません。

自動句読点などの設定は、音声入力ポップアップの歯車アイコンから開きます。止めるときはマイクボタンを押すか、音声コマンドで止めます。対応言語に日本語が含まれます。

Macは先に設定を開きます。アップルメニュー → [システム設定] と選び、サイドバーで [キーボード] をクリックして [音声入力] をオンにします。オンにするときは [有効にする] をクリックします。

開始のショートカットは [ショートカット] ポップアップメニューから選ぶ形で、独自のショートカットを作ることもできます。終了はEscapeキー、マイクキー、または同じショートカットです。30秒間音声が検出されないと自動で止まります。

長さについて、Appleは音声入力できるテキストの長さに制限はなくタイムアウトもないと書いています。ただし30秒の無音で止まるので、会議の音を通しで流し続ける使い方には向きません。区切りながらの口述には使えます。

行き先も確認できます。入力した音声と文字起こしがSiriサーバには送信されずデバイス上で処理されるかどうかを「キーボード」設定の画面で確認できる、とAppleが案内しています。法務ページはさらにはっきりしていて、キーボード設定で指定されている場合は音声と文字起こしがデバイス上で処理されAppleのサーバには送信されず、指定されていない場合はサーバへ送られて処理されると書かれています。

サーバへ送られる場合でも、「Siriと音声入力の改善」を選択しない限り音声データは保存されないとAppleは書いています。リクエストの履歴は1時間に複数回変わるランダムな識別子に紐づけられ、Apple Accountやメールアドレスとは結び付けられません。保持は最長2年です。

なお、iPhoneの音声入力の設定経路と操作手順は、Appleの公式ページで本文を確認できませんでした。検索結果の要約には経路が出てきますが、原文を自分で確かめられていないので、ここには書きません。

画面で読むだけなら、ライブキャプションがある

Chromeにはライブキャプションがあります。ブラウザで再生している動画・ポッドキャスト・ゲーム・ライブ配信・ビデオ通話などの音声に字幕を付ける機能で、ページ側の対応は要りません。日本語を含む言語に対応しています。

処理の場所について、公式ヘルプは「すべての音声と字幕はローカルで処理され、保存されることやデバイスの外部に送信されることはありません」と書いています。ただし同じページの冒頭には、字幕を生成してGoogleに送信し翻訳できるとも書かれています。翻訳を使う経路では、Googleへ送られます。

記録には使えません。保存されないと明記されている以上、あとから読み返す議事録の材料にはならないためです。オンにすると通常よりも多くの電力を消費するという注意もあり、リアルタイム翻訳を使う際はChromebookを電源に接続する必要があると書かれています。

うまくいかないとき

原因と対処を対で並べます。多くは故障ではなく、権限か対応環境か契約です。

症状公式に挙がっている原因対処
マイクのボックスは出るが文字が入らないマイクが動作していないパソコンのシステム設定でマイクの設定を確認する。Macは「システム設定」、Windowsは「コントロール パネル」
音声がよく聞き取れない公式のトラブルシューティングに項目があるマイクの状態を確かめ、静かな場所で試す
「句読点」と言っても記号が入らない音声コマンドは英語のみ日本語では文字入力までと割り切る。一部の言語では句読点そのものが使えない
症状考えられる条件対処
[音声入力] がメニューに無い組織で機能が無効にされている可能性がある管理者に確認する
マイクの許可を自分で変えられないネットワーク管理者が設定していることがある情報システム部門に相談する
ディクテーションのボタンが灰色公式のトラブルシューティングに項目があるサブスクリプションの状態とサインインを確かめる
Firefoxで音声入力が始まらない対応ブラウザに挙がっていないChrome / Edge / Safari の最新バージョンで開く
症状考えられる条件対処
開始したはずなのに録れていない別タブや別アプリの使用中は録音を開始できないそのタブを前面にしてから開始する
裏に回したあと取りこぼした非表示かつ無音が続くとタイマーが抑制されるタブを固定し、前面のまま使う
戻ったらページが初期状態だった非アクティブなタブは戻ると自動的に再読み込みされるタブを固定する。区切って保存する
変換に音声と同じくらい待たされる所要時間は音声の長さと同じくらいかかることがある会議直後に必要なら、その場で認識する型を併用する

精度の側で困っているときは、道具ではなく音を先に疑ってください。マイクの位置と部屋の静けさは、どのサービスでも同じだけ効きます。設定でどうにもならない範囲は話者が分かれなかったときの対処にまとめました。

上限に当たった場合は、待つか移るかの二択です。ファイルを上げる型は月あたりの合計で切られるものが多く、上限の手前で止まると作業が丸ごと止まります。月に何本処理するかを先に数えておくと、無料の範囲で足りるかどうかが先に分かります。

なお、うちのRecoryはiPhone専用のアプリなので、ブラウザだけで済ませたい方の選択肢には入りません。会社のPCにソフトを入れられないという条件なら、この記事で挙げた手段の組み合わせで考えてください。

ブラウザで完結する方法が中心です。ほかのやり方も含めた整理は文字起こしとはにあります。

ブラウザ以外も含めた横断の比較は文字起こしアプリの比較にあります。動く場所の違いで整理しました。

ブラウザ型で分析機能まで持つ無料のサービスはユーザーローカル音声議事録システムにまとめました。


仕様は2026年9月2日時点の公式サイトの記述に基づきます。OSのバージョンで名前や場所が変わるので、お手元でご確認ください。

よくある質問

ブラウザだけで文字起こしはできますか

できます。ブラウザの音声認識を使ってその場で文字にする方法と、音声ファイルをアップロードして処理する方法の2通りがあります。どちらもソフトのインストールは要りませんが、後述する共通の弱点があります。

なぜ途中で止まるのですか

ブラウザは、表示していないタブの処理を抑える作りになっているためです。別のタブに切り替える、画面を消す、他のアプリを前に出すといった操作で、認識が止まったり取りこぼしたりします。会議の資料を見ながら使うと起きやすくなります。

長時間の会議でも使えますか

苦手です。ブラウザで動かし続ける方式は、途中で止まっても気づきにくいという弱点があります。1時間を超える会議では、録音そのものは別の手段で確実に取り、あとからファイルを渡す形にするほうが安全です。

話者は分かれますか

ブラウザの音声認識だけを使う方式では、基本的に分かれません。アップロード型のサービスには話者分離に対応するものもありますが、無料の範囲では対象外になっていることが多いです。

会社のPCで使っても大丈夫ですか

音声がどこへ送られるかを確認してからにしてください。ブラウザ内で完結するものと、サーバーへ音声を送るものがあり、見た目では区別がつきません。社外秘の会議では、社内の規定に照らして判断する必要があります。

ブラウザだけで録音もできますか

できます。ブラウザにはマイクから音を録る仕組みが標準で入っていて、それを使った録音サイトがあります。ただしタブを閉じたり再読み込みしたりすると録音が消えるので、会議の記録には向きません。端末の録音アプリは録った時点で保存されるので、そちらのほうが安全です。

ブラウザで文字起こしをすると、音声はどこへ送られますか

サイトの作りによります。MDNの英語版には、音声認識は通常オンラインのサービスで行われ、録音がサーバーへ送られて処理されると書かれています。端末の中で処理する指定もありますが、その指定をfalse(既定値)にしたときは、ローカルか遠隔かをブラウザ側が選べるとされています。つまり既定ではどちらになるか公式には決まっていません。

Googleドキュメントの音声入力はどのブラウザで使えますか

Chrome・Edge・Safariの最新バージョンです。公式ヘルプにこの3つが挙がっていて、Firefoxは一覧にありません。経路は [ツール] → [音声入力] で、マイクのボックスが出たらマイクをクリックして話し、終わったらもう一度クリックして止めます。

Googleドキュメントの音声入力に時間の上限はありますか

公式ヘルプに記載を確認できませんでした。1回に連続して認識できる長さの上限も、別のタブへ切り替えたときの挙動も書かれていません。「上限が無い」と書かれているわけではないので、長い会議を任せる前に短い音声で試してください。

タブを切り替えると文字起こしは止まりますか

Chromeの公式資料では、マイクを使っているページはフリーズの対象外とされています。ページが表示されている、または直近30秒に音を出していれば、タイマーの抑制も最小限です。ただし別のタブや別のアプリを使用している場合、サイトは録音・録画を開始できないと公式ヘルプに書かれているので、開始の操作だけはそのタブを前面にして行ってください。

ブラウザ版のWordで録音ファイルを文字起こしできますか

一般の法人・個人の契約ではできません。公式ページに、この機能は商用テナントではWindows上のWord for Microsoft 365でのみ利用でき、Word for the web での文字起こしは政府機関テナント向けだと書かれています。ブラウザ版で使えるのは、マイクに向かって話すディクテーションのほうです。

ブラウザで録音したデータはどこに保存されますか

保存の操作をするまで、ファイルとしては存在しません。MDNの説明では、録れた音はメディアデータを含むBlobとして渡され、残すにはダウンロードさせる操作が別に要ります。端末の録音アプリは録った時点で保存されるので、記録を確実に残したいならそちらが安全です。

Google MeetやTeamsの文字起こしはブラウザから使えますか

Teamsのライブ文字起こしは、デスクトップ用Teamsでのみ使用できると公式に書かれています。Google Meetの文字起こしは有料エディション限定で、対応環境はパソコン・ノートパソコン・Androidデバイスのみです。どちらも文字起こしを始めると参加者に分かる作りになっています。

会社のパソコンでブラウザの文字起こしを使ってもいいですか

社内規程の確認が先です。職場や学校でChromeを使っている場合、ネットワーク管理者がカメラとマイクの設定を行っていて変更できないことがある、と公式ヘルプに書かれています。個人情報保護委員会のQ&Aは、クラウド利用の判断基準を「その事業者が個人データを取り扱うこととなっているか」だとしています。個別の判断は弁護士にご確認ください。

Chromeのライブキャプションを議事録に使えますか

使えません。公式ヘルプに、すべての音声と字幕はローカルで処理され、保存されることやデバイスの外部に送信されることはないと書かれています。保存されない以上、あとから読み返す材料にはなりません。なお同じページには、字幕を生成してGoogleに送信し翻訳できるという記載もあります。

マイクの許可を取り消すにはどうすればいいですか

Chrome右上のその他アイコン → [設定] → [プライバシーとセキュリティ] → [サイトの設定] → [権限] → [マイク] を開き、該当サイトの右にある削除アイコンを選びます。同じ画面で既定の入力デバイスも選べます。職場のPCでは管理者の設定により変更できない場合があります。

無料で3会議ためす登録もカードも不要・iPhone専用 試す