Whisperで文字起こし——「ローカル」と「API」は正反対の道具です
同じWhisperでも、手元で動かすなら音声は1バイトも外に出ず、APIを叩くならOpenAIへ送られます。モデル6種の必要メモリ、話者分離が付いていないこと、APIの25MB上限が実務で何分に当たるかまで、公式の記載だけで整理しました。

Whisperは、OpenAIが公開している音声認識のモデルです。コードとモデルの重みの両方がMITライセンスで出ているので、手元のパソコンで動かせます。
この記事の内容(28項目)
- 音声がどこへ行くか
- Whisperができるのは3つだけ
- モデルは6種類。選ぶ基準はメモリ
- モデル名は14種類。`large` は large-v3 の別名です
- 「約8倍速」はA100の数字です
- 話者分離は付いていません
- 「話者分離が無い」の裏取り
- whisper.cpp の話者区切りは、英語専用です
- 環境構築をしたくない場合
- 手元で動かすまでの手順
- 3つの実装を並べる
- APIを使うなら、25MBの壁を先に見る
- APIの料金——1時間の会議がいくらになるか
- whisper-1 は2027年2月26日にAPIから消えます
- APIの細かい上限を先に見る
- 課金の入口——前払いクレジットと無料ティア
- 日本の消費税と、適格請求書
- リアルタイムには使えません
- APIに送った音声はどう扱われるか
- ISO 27001 の範囲は「OpenAIのサービス」です
- 向く場面・向かない場面
- 日本語の精度は、公式に数字が出ていません
- 幻覚と繰り返しは、公式が認めた限界です
- 録音してよいかどうかは、Whisperの外の話です
- どこまでを自分でやるか
- 「無料」の内訳を分解する
- 立場で分ける——誰が使うべきか
- 公式に記載を確認できなかったこと
ただ、「Whisperを使う」と言ったとき、まったく性質の違う2つが同じ名前で呼ばれています。ここを取り違えると、社外に出せない音声を外へ送ることになります。
音声がどこへ行くか
| 手元で動かす | APIを叩く | |
|---|---|---|
| 音声の行き先 | 外に出ない | OpenAIへ送られる |
| 費用 | 無料(MITライセンス) | 有料 |
| 1ファイルの上限 | なし | 25MB |
| 話者分離 | 付いていない | gpt-4o-transcribe-diarize で対応 |
| 用意するもの | Python・PyTorch・ffmpeg | APIキー |
社外に出せない会議で意味があるのは、左側だけです。右側は、名前がWhisperというだけで、他のクラウドの文字起こしサービスと立場は同じになります。オフラインで文字起こしをする方法を探してこの記事に来たなら、見るべきは左です。
Whisperができるのは3つだけ
公式リポジトリが挙げるWhisperの能力は3つです。多言語の音声認識(文字起こし)、音声の翻訳、言語判定。この3つ以外は書かれていません。
翻訳には方向の制限があります。公式ドキュメントに「このエンドポイントは英語への翻訳のみ対応する」と記載があり、日本語の会議を英語にはできますが、英語の会議を日本語にはできません。日英が混ざる会議の記録を考えているなら、ここは先に確認しておく項目です。
| 公式に書かれている能力 | 補足 |
|---|---|
| 多言語の音声認識 | 文字起こし。ここが主用途 |
| 音声の翻訳 | 英語への一方向のみ |
| 言語判定 | 何語で話しているかの推定 |
仕組みも公式に書かれています。Whisperは音声を30秒ずつに区切り、その区切りごとに順に予測して文字にします。1時間の会議も、この30秒ごとの処理を積み重ねた結果です。
そして、この3つの外にあるものが分かりやすい。要約も、議事録の生成も、話者の振り分けも入っていません。公式モデルカードはWhisperを「音声認識と音声翻訳のモデル」と定義していて、要約に相当する記載はありません。
学習データの内訳も公表されています。ウェブから集めた68万時間の音声と、対応する書き起こしです。
| 学習データ | 時間 | 割合 |
|---|---|---|
| 全体 | 680,000時間 | 100% |
| 英語の音声 | 438,000時間 | 65% |
| 非英語の音声と書き起こし | 117,000時間 | 17% |
日本語は、この11万7千時間を98の言語で分け合う側にいます。この構造を頭に置いておくと、あとで出てくる精度の話が読みやすくなります。英語での結果をそのまま日本語に当てはめられない理由が、学習データの段階から用意されています。
モデルは6種類。選ぶ基準はメモリ
公式に載っている表です。VRAMは、グラフィックの処理に使えるメモリのことで、ここが足りないとそのモデルは動きません。
| モデル | パラメータ数 | 必要VRAM | 速さ |
|---|---|---|---|
| tiny | 39 M | 約1 GB | 約10倍 |
| base | 74 M | 約1 GB | 約7倍 |
| small | 244 M | 約2 GB | 約4倍 |
| medium | 769 M | 約5 GB | 約2倍 |
| turbo | 809 M | 約6 GB | 約8倍 |
| large | 1550 M | 約10 GB | 1倍 |
turbo に目を留めてください。large の約半分の大きさで、速さは約8倍です。medium より少し大きいだけで、medium の4倍速く動きます。迷ったらここから試すのが素直です。
英語だけを扱うなら tiny.en base.en small.en medium.en という英語専用版もあります。日本語で使うなら、専用版ではないほうを選びます。使うときは言語を指定します。
whisper japanese.wav --language Japanese
指定しないと自動で判定しますが、会議の冒頭が英語の挨拶だと英語だと思い込むことがあるので、日本語だと分かっているなら書いたほうが安全です。
モデル名は14種類。large は large-v3 の別名です
上の表は6つですが、実際にダウンロードできるモデル名は14あります。whisper/__init__.py に一覧があり、large-v1 large-v2 large-v3 large-v3-turbo を個別に指定できます。
large と書いたときに落ちてくるのは large-v3 です。turbo は large-v3-turbo です。コードの中でダウンロード先のURLを見ると、末尾のファイル名が large-v3.pt になっていることで確認できます。
| 書く名前 | 実際に落ちてくるもの |
|---|---|
large | large-v3 |
turbo | large-v3-turbo |
large-v2 | large-v2(旧版を明示的に指定) |
古いバージョンを名前で呼べるのは実用上ありがたい点です。large-v3 に切り替えたら手元の音声で結果が悪くなった、という場合に large-v2 へ戻せます。同じ「Whisper」でもバージョンによって結果は変わるので、比較の記録を取るときはバージョンまで書いておくことになります。
turbo には但し書きがあります。翻訳タスクの学習を受けていません。英語へ翻訳したいなら medium か large を使うことになり、文字起こしだけなら turbo で問題ありません。公式は turbo を「large-v3 を速度向けに最適化したもので、精度の低下はわずか」と説明しています。
もう1つ、公式ドキュメントのなかで数字が食い違っている箇所があります。turbo のパラメータ数は、READMEの表では809 M、モデルカードの表では798 Mです。どちらが正しいかを示す記載は確認できませんでした。実用上の影響はありませんが、他所で見た数字と合わないときの原因はここです。
リポジトリは現役です。アーカイブされておらず、最新のリリースはv20250625(2025年6月26日)。large-v3-turbo は1つ前のv20240930で追加されました。
「約8倍速」はA100の数字です
上の表の「速さ」は相対値で、測った環境が公式に書かれています。NVIDIA A100(データセンター向けのGPU)で英語の音声を処理した場合の値です。
READMEはそのうえで、実際の速度は言語・話速・使えるハードウェアなど多くの要因で大きく変わると明記しています。A100は個人が机の上に置く機材ではありません。手元のMacやWindowsのノートで、この倍率がそのまま出ることはありません。
では手元でどれくらいかかるのか。openai/whisper の公式資料には、Apple SiliconやWindowsノートでの実測値がありません。数字を出しているのは派生プロジェクトの側です。
以下は faster-whisper の公式READMEに載っている実測で、13分の音声を処理した時間です。openai/whisper と whisper.cpp と faster-whisper を同じ条件で並べたもので、OpenAIによる検証ではありません。
| CPUのみ(i7-12700K・8スレッド・small) | 13分の音声にかかった時間 |
|---|---|
| openai/whisper | 6分58秒 |
| whisper.cpp | 2分05秒 |
| faster-whisper(int8) | 1分42秒 |
| GPU(RTX 3070 Ti・8GB・large-v2) | 13分の音声にかかった時間 |
|---|---|
| openai/whisper | 2分23秒 |
| faster-whisper | 1分03秒 |
| faster-whisper(バッチ処理) | 17秒 |
読み取れることが2つあります。CPUだけで本家を動かすと、13分の音声に7分近くかかります。同じ比率で単純に延ばすと、1時間の会議は30分を超える計算になります。
もう1つは、実装を替えるだけで結果が大きく変わることです。faster-whisper は「同じ精度で openai/whisper の最大4倍速く、メモリの使用量も少ない」と自ら書いていて、上の数字はその主張と整合します。無料であることと、待たなくていいことは別の話です。
話者分離は付いていません
ここがいちばん大きい制約です。公式リポジトリに話者分離(diarization)の記載はありません。文字は起こせますが、誰が話したかは分かりません。
3人以上の会議で「決めたのは誰か」「宿題を持ち帰ったのは誰か」を残したいなら、これは致命的です(なぜ話者分離が要るか)。足す道はあります。pyannote/speaker-diarization-3.1 のような別のライブラリを組み合わせて、話者の区間を出してからWhisperの文字と突き合わせる形です。ただしWhisperを動かすのとは別の環境構築になり、日本語での精度も自分で確かめることになります。
「話者分離が無い」の裏取り
否定的なことを書くときは、どこを見て無かったのかを示すのが筋です。Whisperの話者分離については、4か所で確認しました。
まず公式READMEです。機能として挙げられているのは多言語の音声認識・音声翻訳・言語判定の3つで、話者分離の記載はありません。
次に公式モデルカード。話者分離(speaker diarization)という語は出てきますが、位置づけが決定的です。音声区間検出・話者分類・話者分離といったタスクでファインチューニングすれば追加の能力を示す可能性があるが、これらの領域で頑健に評価されていない、と書かれています。搭載機能ではなく、未評価の可能性として扱われています。
3つ目はソースコードです。whisper/tokenizer.py に、話者タグや非発話の注記を避けるために抑制するトークンの一覧を返す関数があります。単に無いのではなく、話者名の出力を積極的に抑える作りになっています。
| 見た場所 | 結果 |
|---|---|
| README の機能一覧 | 記載なし |
| モデルカード | 「未評価の可能性」として言及 |
| tokenizer.py | 話者タグを抑制するコードがある |
| transcribe.py | タスクは transcribe と translate の2択 |
4つ目はコマンドラインの引数です。whisper/transcribe.py のタスクの選択肢は transcribe(文字起こし)と translate(英語へ翻訳)の2つだけで、話者分離を指定するオプションはありません。
OpenAIのAPI側には話者分離ができるモデルがあります。ただしそれは gpt-4o-transcribe-diarize という別のモデルで、Whisperではありません。公式ガイドも「録音のどの部分を誰が話したかを識別する必要があるときだけ gpt-4o-transcribe-diarize を使え」という書き方です。この移行先には期限の問題があり、あとで書きます。
whisper.cpp の話者区切りは、英語専用です
派生実装のひとつ whisper.cpp には tinydiarize という機能があります。名前から話者分離を期待しますが、日本語では使えません。
対応するモデルが small.en-tdrz の1つだけで、末尾の .en が示すとおり英語専用のモデルだからです。公式のモデル取得スクリプトに登録されている tdrz 対応モデルはこれだけでした。
出力の形も期待とずれます。得られるのは [SPEAKER_TURN] という印だけで、話者が交代した位置が分かります。誰が話したかの識別ではなく、「話者A」「話者B」のようなラベルも付きません。
| tinydiarize | 期待されがちなもの | |
|---|---|---|
| 対応モデル | small.en のみ(英語専用) | 多言語 |
| 出力 | [SPEAKER_TURN] の印 | 話者A・話者Bのラベル |
| 位置づけ | 実験的(公式が明記) | 製品として使える機能 |
結局、日本語で誰が何を言ったかを残したいなら、Whisperの外側に別の仕組みを足すことになります。faster-whisper のREADMEには WhisperX や whisper-diarization といった派生プロジェクトが並んでいますが、これは「Community integrations」という見出しで、利用者が自由に追加できる網羅的でない一覧という前置きが付いています。公式の推奨ではありません。
環境構築をしたくない場合
公式の案内は Python 3.8〜3.11 と PyTorch と ffmpeg です。ここで止まる人は多いと思います。
プログラムを書かずに使いたいなら、whisper.cpp を土台にしたGUIアプリを使う道があります。Macなら MacWhisper が知られていて、無料版もあります。C++で書き直された whisper.cpp は Python も PyTorch も要りません。
faster-whisper は、同じモデルをより速く動かすための実装です。名前が似ていますが別のプロジェクトで、どれも「Whisperのモデルを、別の方法で走らせるもの」だと思うと整理がつきます。
superwhisper は、用途がひとつ違います
名前が近いので並べて検討されがちですが、superwhisper は「会議を録って議事録にする」道具ではありません。話した内容をその場でテキストにして、SlackやGmailの入力欄へ流し込む——キーボードの代わりにあたる道具です。
| superwhisper | Whisper(この記事) | |
|---|---|---|
| 用途 | 話して打つ(ディクテーション) | 録った音声をあとから文字にする |
| 対応 | macOS / Windows / iOS | Python が動く環境 |
| 音声の行き先 | オフライン対応(Apple Silicon はオフラインのモデルが最適、Intel Mac はクラウド推奨と案内) | 手元で動かせば外に出ない |
| 無料の範囲 | 3,000語まで試用。その後も無料の機能は使える | 全部無料(MITライセンス) |
| 使うモデル | 音声は Whisper Large、言語モデルは GPT-5 が既定 | Whisper のみ |
土台にWhisperを使っている点は同じですが、会議の記録が目的ならこちらではありません。逆に、メールやメモを声で書きたいなら、whisper コマンドを覚えるより早い。
手元で動かすまでの手順
公式の導入手順は2つだけです。pipでのインストールと、ffmpegの導入。
インストールのコマンドはこれです。
pip install -U openai-whisper
ffmpegは別に入れます。公式はmacOSならHomebrew、WindowsならChocolateyやScoop、Ubuntu/DebianやArchのコマンドを並べています。環境によってはRustの導入も要ると書かれていて、ここで詰まる報告は多い箇所です。
実行はこの形です。既定のモデルは turbo です。
whisper japanese.wav --language Japanese
書き出せる形式は5つです。pip install -U openai-whisper で入る最新版(v20250625)の選択肢は txt / vtt / srt / tsv / json でした。
| 形式 | 用途 |
|---|---|
| txt | 素のテキスト |
| srt / vtt | 字幕(時刻付き) |
| tsv / json | 表計算やプログラムで扱う |
docxやpdfは選択肢にありません。ただし「非対応」と明記した公式の記述は見つかりませんでした。Wordの文書として配りたいなら、txtを開いて自分で整えることになります。
対応OSを列挙した記述も公式にありません。READMEはPython 3.8〜3.11とPyTorch、ffmpegの導入手順をUbuntu/Debian・Arch・macOS・Windowsについて示していますが、動作対象のOS一覧という形の記載は確認できませんでした。
1ファイルの長さやサイズの上限も、ローカル版には記載がありません。30秒ごとに区切って順に処理する作りなので、長さの限界は実質的に手元の計算時間で決まります。3時間の研修を丸ごと渡しても、待てるなら通ります。
3つの実装を並べる
「Whisper」と呼ばれるものには、同じモデルを別の方法で走らせる実装が複数あります。faster-whisper と whisper.cpp は、OpenAIの公式プロジェクトではありません。それぞれ SYSTRAN と ggml-org が公開している第三者のプロジェクトです。
| openai/whisper | faster-whisper | whisper.cpp | |
|---|---|---|---|
| 提供元 | OpenAI | SYSTRAN | ggml-org |
| 実装 | Python | Python(CTranslate2) | C/C++ |
| ライセンス | MIT | MIT | MIT |
| 売り | 本家 | 同じ精度で最大4倍速 | Apple Silicon最適化 |
whisper.cpp は Apple Silicon を第一級の対応対象と明記していて、推論はMetal経由でGPU上で動きます。macOS・iOS・Android・Windows・Linux・WebAssemblyに対応し、iPhone上で完全にオフラインで動く例も公開されています。
Core ML対応でビルドすると、エンコーダ部分をApple Neural Engineで実行できます。公式は「CPUのみの実行と比べて3倍超の高速化」としています。ただしCore MLモデルの生成にはXcodeとcoremltoolsの導入が別に要り、初回の実行は端末側でのコンパイルのぶん遅くなります。
必要なメモリも whisper.cpp 側のほうが軽く出ています。本家の表が large で約10GBのVRAMとしているのに対し、こちらは約3.9GBです。
| モデル | ディスク | メモリ(whisper.cpp) |
|---|---|---|
| tiny | 75 MiB | 約273 MB |
| small | 466 MiB | 約852 MB |
| medium | — | 約2.1 GB |
| large | 2.9 GiB | 約3.9 GB |
smallまでなら1GBを切るので、手元のノートでも見込みが立ちます。largeを常用したいならメモリの余裕が要りますが、本家のVRAM要件よりは現実的な数字です。
入力の形式には注意が要ります。既定のビルドの whisper-cli は16ビットのWAVしか直接読めないので、mp3やm4aはffmpegで16kHz・モノラルのWAVへ変換してから渡します。WHISPER_COMMON_FFMPEG を有効にしてビルドすれば他の形式も扱えると公式READMEに記載があります。
APIを使うなら、25MBの壁を先に見る
APIには1ファイル25MBの上限があります。対応する形式は mp3・mp4・mpeg・mpga・m4a・wav・webm です。25MBが実務で何分かは、音質で変わります。
| ビットレート | 25MBで録れる長さ |
|---|---|
| 64 kbps | 約52分 |
| 96 kbps | 約35分 |
| 128 kbps | 約26分 |
1時間の会議は、そのままでは入りません。分割するか、ビットレートを落として録り直すことになります。長い録音を分けるときの注意はこちらにまとめました。
モデルは gpt-transcribe が推奨で、whisper-1 はタイムスタンプと翻訳の用途として案内されています。話者分離が要るなら gpt-4o-transcribe-diarize です。ここだけはローカル版に無い利点です。
APIの料金——1時間の会議がいくらになるか
whisper-1 の料金は音声1分あたり0.006米ドルです。トークンではなく音声の長さで課金されるので、話していない時間も同じように課金されます。
| 会議の長さ | whisper-1(米ドル) |
|---|---|
| 30分 | $0.18 |
| 1時間 | $0.36 |
| 月20本×1時間 | $7.20 |
| 月100本×1時間 | $36.00 |
分課金の効き方は分かりやすい形です。会議の総時間に比例するので、月に何時間録るかが決まれば費用は先に計算できます。逆に、上限のあるプランと違って使うほど無制限に増えます。
公式の料金表には後継のモデルも並んでいます。文字起こし系の単価はこうです。
| モデル | 1分あたり |
|---|---|
| gpt-4o-mini-transcribe | $0.003 |
| gpt-transcribe | $0.0045 |
| Whisper(whisper-1) | $0.006 |
| gpt-live-transcribe | $0.017 |
whisper-1 は、後継より高いほうにいます。同じ表で gpt-transcribe が0.0045ドル、gpt-4o-mini-transcribe が0.003ドルです。速度や精度の比較は別として、単価だけを見れば whisper-1 を選ぶ理由は価格にありません。
話者分離ができる gpt-4o-transcribe-diarize は、課金の仕組み自体が違います。分単位ではなくトークン課金で、100万トークンあたり入力2.50米ドル・出力10.00米ドルです。公式の料金表には1分0.006米ドルという数字も載っていますが、この列の見出しは「推定コスト」で、請求の単位ではありません。
価格の表示はすべて米ドルです。日本語の公式料金ページを見ても、円建ての単価表は確認できませんでした。そして日本語の料金ページには Whisper が1件も出てきません。文字起こし系で載っているのは GPT-Live-Transcribe と GPT-Transcribe と GPT-Realtime-Translate の3つだけでした。
「データレジデンシー +10%」という表示が日本語の料金ページにありますが、これはWhisperには効きません。加算の対象は2026年3月5日以降にリリースされ、かつデータレジデンシーの対象となるモデルに限ると注記されていて、whisper-1 は2022年から2023年のモデルです。
ChatGPTの契約とも別です。公式は「OpenAI API の利用料金は、ChatGPT Plus、Business、Enterprise、Edu とは別に課金されます」と明記しています。ChatGPTに月額を払っていても、Whisper APIの分は別に発生します。
whisper-1 は2027年2月26日にAPIから消えます
これは検討の前提を変える話です。OpenAIは2026年8月26日に whisper-1 の非推奨を通知し、2027年2月26日にAPIから削除すると告知しました。
| 日付 | |
|---|---|
| 非推奨の通知 | 2026年8月26日 |
| APIからの削除 | 2027年2月26日 |
| 推奨される移行先 | gpt-live-transcribe / gpt-transcribe |
同じ告知に、もう1つ見落とせない行があります。話者分離ができる gpt-4o-transcribe-diarize も同じ日に削除されます。gpt-4o-transcribe と gpt-4o-mini-transcribe も同日です。「話者分離が要るなら gpt-4o-transcribe-diarize へ」という案内は、そのまま受け取ると半年で行き止まりになります。
削除の対象はAPIの側だけです。GitHubで配布されているオープンソース版のWhisperは、この告知の対象ではありません。手元にモデルの重みを落として動かしている分には、2027年2月26日を過ぎても動き続けます。ここでもローカルとAPIは正反対に振れます。
OpenAI自身が、Whisperを過去のものとして扱い始めています。2022年9月21日の日本語の発表ページには、現在の音声・文字起こし機能については別のモデルを見るようにというバナーが出ます。日本語ヘルプのAudio API FAQも whisper-1 を「legacy」の側に置いていて、公式の音声ガイドの冒頭は gpt-transcribe から始めるよう案内しています。
日本語の公式サポート文書は薄いままです。OpenAIの日本語ヘルプセンターにはWhisper専用のコレクションがありますが、収録されている記事は「Audio API に関する FAQ」の1本だけでした。オープンソース版についての日本語の技術ドキュメントは確認できませんでした。READMEもモデルカードも英語のみです。
APIの細かい上限を先に見る
25MBのほかにも、実装に入ってから気づくと面倒な制限がいくつかあります。
| 項目 | 上限・条件 |
|---|---|
| 1ファイルのサイズ | 25 MB |
| 対応形式 | mp3・mp4・mpeg・mpga・m4a・wav・webm |
| プロンプト | 224トークン |
| 音声のURL指定 | できない(ファイル本体を送る) |
プロンプトは、固有名詞の読み替えヒントを渡す仕組みです。上限は224トークンなので、長い用語集を丸ごと渡す使い方はできません。社名と製品名を数個ずつ、が現実的な分量です。
音声ファイルのリンクを渡すこともできません。日本語ヘルプにも「いいえ、サポートされているいずれかの音声形式のファイルを送信する必要があります」と明記されています。クラウドストレージに置いてURLを渡す、という設計は成り立ちません。
分割するときの注意も公式に書かれています。25MBを超える録音は圧縮するか25MB以下に分けることになりますが、文の途中で切らないよう注意するという一文が添えられています。文脈が失われて精度が落ちるためです。
出力の形式はAPI版のほうが少し違います。text / json / verbose_json に加えて、字幕形式のSRTとVTTが選べます。verbose_json はタイムスタンプ付きの構造化データを返します。
単語単位・区間単位のタイムスタンプについては、ここに whisper-1 を選ぶ理由が1つあります。timestamp_granularities[] パラメータに対応するのは whisper-1 だけで、他の文字起こしモデルでは使えないと公式ドキュメントに記載があります。細かい時刻が要る用途では、いまのところ代わりがききません。
なお、1ファイルの最大再生時間についての記載は確認できませんでした。制限として書かれているのはサイズだけです。
課金の入口——前払いクレジットと無料ティア
APIを使うには、先にクレジットを買います。最低購入額は5米ドルで、初期設定の購入額は10米ドルです。
ここに期限があります。購入したクレジットは1年後に失効し、返金されません。OpenAIは有効期限を延長できないと明記しています。年に数回しか使わない用途で多めに買うと、使い切れない分は消えます。
| 内容 | |
|---|---|
| 最低購入額 | 5米ドル |
| 既定の購入額 | 10米ドル |
| 有効期限 | 1年(返金なし) |
新規のアカウントはこの前払い方式ですが、月額請求を使っている利用者もいます。公式ヘルプに「すでに月額請求をご利用の場合、クレジットを前払いで購入することもできます。これらのクレジットは、毎月の請求額から差し引かれます」という記載があります。
年払いの割引はありません。というより、月額プラン・年額プランという区分そのものが公式に存在せず、年払いで安くなるという記載を確認できませんでした。
無料ティア(Free)は、付与クレジットの話ではなくレート上限と利用上限の区分です。対象地域にいることが条件で、日本は対応国・地域の一覧に含まれます。
| ティア | 月あたりの利用上限 |
|---|---|
| Free | $100 |
| Tier 1 | $100(Freeと同額) |
| Tier 2 | $500 |
| Tier 5 | $200,000 |
5米ドルを払うとTier 1になりますが、月の利用上限は上がりません。上がるのはリクエストの頻度のほうです。whisper-1 の場合、Freeでは毎分3リクエスト・1日200リクエストで、Tier 1では毎分500リクエストになります。金額の上限が動くのは、累計50米ドルを支払うTier 2からです。
解約の手続きについては、従量課金のため契約解除という概念がなく、API利用を止める手順を定めた公式ページを確認できませんでした。返金についても、確認できたのは「購入クレジットは1年後に失効し返金されない」と「法令上の義務や契約上の明示的な例外を除き料金は返金されない」の2点だけです。通常利用での返金申請の窓口は、日本語ヘルプでは不正利用の相談しか見つかりませんでした。
日本の消費税と、適格請求書
経理に回すときに要る情報です。日本の利用者には OpenAI OpCo, LLC が10%の日本の消費税(JCT)を請求します。適用開始は2025年1月1日で、2024年12月31日までの請求分にはさかのぼって課税されません。
公式の価格表示は米ドルで、料金ページにもモデルページにも税の記載はありません。税抜だと分かるのは、このJCTのヘルプ記事を読んだときです。
適格請求書発行事業者の登録番号は T3700150133253 です。価格表示は米ドルのままで、適格請求書には税額が日本円で記載されると案内されています。
| 内容 | |
|---|---|
| 消費税の徴収開始 | 2025年1月1日 |
| 登録番号 | T3700150133253 |
| 登録年月日 | 2026年1月1日 |
| 価格の表示 | 米ドル(税額のみ日本円) |
日付が2つあることに注意してください。消費税の徴収が始まった日と、適格請求書発行事業者としての登録日は1年ずれています。仕入税額控除の扱いを社内で確認するなら、見るのは登録日のほうです。
法人の扱いは別です。Enterprise契約などの個別契約で使う法人には、一般にリバースチャージの仕組みが適用され、消費税は課されないと案内されています。その場合、税額の算定・申告・納付はサービスを受ける日本の事業者側が負います。
契約の相手はOpenAI OpCo, LLCです。登記事務所は 1455 Third Street, San Francisco, California 94158, 米国。OpenAIのサービス契約は、EEAまたはスイス以外に所在する顧客の契約当事者をこの法人と定めていて、日本に契約主体となる法人は置かれていません。OpenAIは2024年4月14日に東京オフィスの開設を発表していますが、それは契約主体の話とは別です。
リアルタイムには使えません
会議中に画面へ文字が流れていく——という使い方を期待しているなら、Whisperは選択肢に入りません。公式モデルカードが「Whisperのモデルは、そのままではリアルタイムの文字起こしには使えない」と明記しています。30秒ごとに区切って処理する作りなので、そもそも即時性を狙った設計ではありません。
API版も同じです。OpenAI公式ヘルプセンターの日本語ページに「whisper-1 モデルではストリーミングはサポートされていないことに注意してください」と記載があります。逐次出力ができないので、処理が終わるまで結果は返りません。
| Whisper | gpt-live-transcribe | |
|---|---|---|
| 逐次出力 | 不可 | 対応 |
| 1分あたり | $0.006 | $0.017 |
リアルタイムが要るなら、OpenAIのAPIには gpt-live-transcribe という別のモデルがあります。単価は whisper-1 の約2.8倍で、即時性には値段が付いている形です。
会議の場で文字が出ることに意味があるかどうかは、用途で分かれます。あとから読む議事録が目的なら、リアルタイムでなくても困りません。その場で聞き逃しを補いたい、耳の遠い参加者がいる、といった場面では、この差が決定的になります。
APIに送った音声はどう扱われるか
APIを使うと決めた場合、ここが最後の確認項目になります。
まず学習利用です。2023年3月1日以降、明示的にオプトインしない限り、APIに送ったデータはOpenAIのモデルの学習や改善には使われないと公式ドキュメントに記載があります。サービス契約の側にも「お客様が明示的にその使用に同意しない限り、本サービスの開発または改善のために顧客コンテンツを使用することはありません」とあります。議事録が学習に使われるかどうかの確認の仕方は別の記事にまとめてあります。
保持期間は、文字起こしのエンドポイントだけ他と違います。公式の表では /v1/audio/transcriptions の行が、学習利用「No」、不正利用監視のためのログ保持「None」、アプリケーション状態の保持「None」です。多くのエンドポイントが30日保持なのに対して、音声は保持なしと書かれています。
| 項目 | /v1/audio/transcriptions |
|---|---|
| 学習への利用 | No |
| 不正利用監視の保持 | None |
| アプリケーション状態の保持 | None |
ゼロデータ保持(ZDR)の対象にもなっています。ただしこの制御は誰でも使えるものではなく、公式は「これらの制御はOpenAIによる事前の承認と、追加要件への同意が前提となる」としています。
「日本で処理される」は誤りです
ここは間違えやすい場所です。保管地域として日本を選べるのは事実で、エンドポイントは jp.api.openai.com です。選べる地域は米国・欧州(EEA+スイス)・オーストラリア・カナダ・日本・インド・シンガポール・韓国・英国・UAEの10でした。
ただし、これは保管の話であって処理の話ではありません。公式ガイドの地域表で日本は「Regional storage: Yes / Regional processing: No」です。同じガイドが、保管地域への対応は処理地域への対応を意味しないと明記しています。
| 日本 | |
|---|---|
| 保管地域として選べるか | はい(jp.api.openai.com) |
| 音声の処理地域に含まれるか | いいえ(米国・欧州のみ) |
そして音声のエンドポイントの処理地域は、米国と欧州(EEA+スイス)だけです。日本国内で処理されるわけではありません。「国内処理だから安心」という説明を見かけたら、この行を確認してください。
なお、ローカルで動かす場合はここに書いたこと全部が関係ありません。モデルの重みを落として手元で推論するので、音声はOpenAIのサーバーを経由しません。API側のデータ方針が適用されない代わりに、保護の責任も全部こちら側に来ます。
ISO 27001 の範囲は「OpenAIのサービス」です
セキュリティチェックシートに書く項目です。OpenAIはISO/IEC 27001:2022の認証を取得していて、認証範囲にAPI、ChatGPT Enterprise、ChatGPT Eduが含まれると公表しています。ISO/IEC 27017:2015、27018:2019、27701:2019の管理策にも適合するとされています。
SOC 2 Type 2の報告書も第三者監査で取得しています。トラストポータルにはISO/IEC 42001:2023、PCI DSS v4.0.1、FedRAMP 20x、CSA STARなども掲載されていました。
ただし、登録番号(証明書番号)は公開ページで確認できませんでした。証明書はトラストポータルの Documents に掲載されているとされますが、閲覧にはアクセス申請が要り、認証機関名も確認できていません。社内へ提出する資料に登録番号まで書く必要があるなら、申請して現物を取ることになります。
| 認証の範囲 | |
|---|---|
| OpenAI API(whisper-1 を含む) | 範囲内 |
| ChatGPT Enterprise / Edu | 範囲内 |
| ローカルで動かすWhisper | 範囲外(管理は利用者の責任) |
そして範囲です。認証の対象は「OpenAIのAPI・ChatGPT Enterprise・ChatGPT Edu」というサービスであって、手元のパソコンに落として動かすWhisperはこの外にあります。
矛盾しているように見えて、実はそうではありません。ローカル実行は「認証された事業者に預けない」ことに意味があるので、認証の外にあるのは当然です。代わりに、そのパソコンの管理・バックアップ・アクセス制限は全部自分で設計することになります。認証を持つ相手に預けるか、自分で全部持つか、という選択です。
向く場面・向かない場面
向く
- 音声を社外に出せない。手元で動かすかぎり、音声もテキストも外に出ません
- 費用をかけたくない。モデルの重みまでMITライセンスです
- 文字にするところまでで足りる。議事録の形は自分で整える
- 量が多い。分数の上限が無いので、何時間でも同じ費用(電気代だけ)です
向かない
- 誰が話したかを残したい。別のライブラリを足す前提になります
- 環境構築に時間を使いたくない(GUIアプリという逃げ道はあります)
- 決定事項や宿題まで整理された議事録が欲しい。Whisperは文字にするところまでです
- 会議のたびに手を動かしたくない。録るたびに自分でファイルを渡すことになります
日本語の精度は、公式に数字が出ていません
いちばん知りたいところが、いちばん確かめにくい項目です。公式ドキュメントは「Whisperは98言語に対応するが、精度は言語ごとに異なる」と明記しています。モデルカードはさらに踏み込んで、強い音声認識の結果が出るのは約10言語としています。どの10言語かの列挙はありません。
READMEには言語別の性能グラフがあり、日本語も載っています。ただし棒グラフに数値のラベルが無く、README本文にもモデルカード本文にも日本語の誤り率の数字は書かれていません。「日本語のWERは◯%」と書ける一次情報を確認できませんでした。
グラフの読み方には1つ手がかりがあります。日本語のラベルは斜体で表示されていて、READMEの凡例によれば斜体はWER(単語誤り率)ではなくCER(文字誤り率)で測った言語を指します。日本語は単語の区切りが無いので、文字の単位で評価されているという意味です。
| 測り方 | |
|---|---|
| 英語など | WER(単語誤り率) |
| 日本語 | CER(文字誤り率) |
日本語の解説記事で具体的な数字が出回っていますが、公式のページで裏を取れませんでした。論文のAppendixに数値があるとされるものの、READMEやモデルカードの本文としては確認できていません。数字を引用するときは、その数字がどこから来たのかを確かめてください。
対応言語の数も、公式のなかで揃っていません。READMEは数を明記せず tokenizer.py を見るよう案内していて、そこに登録されている言語コードは100件です。一方モデルカードは、学習データの非英語部分が98言語としています。この2つが合わない理由の記載は確認できませんでした。日本語(ja / japanese)が tokenizer.py に含まれることは、コードで確認できます。
実務としての結論は単純です。自分の音声で試すしかありません。モデルの大きさ、録音の環境、話者の人数で結果が変わるので、公表値があったとしても、そのまま自分の会議には当てはまりません。
幻覚と繰り返しは、公式が認めた限界です
Whisperには、音声に無い文言を出力する癖があります。公式モデルカードが、予測には音声入力で実際には話されていないテキストが含まれることがある(すなわち幻覚)と明記しています。
原因も書かれています。弱教師あり学習で、ノイズの多いデータを大量に使っているためです。無音の区間やノイズの多い区間で、もっともらしい文が挿入されることがあります。
同じ文言を繰り返す傾向も認められています。ビームサーチや温度調整である程度は軽減できるが完全ではない、という書き方です。会議の記録で同じ一文が何度も続いていたら、まずこれを疑ってください。AIが書いた議事録をどこまで信じるかは、道具を問わず残る問題です。
| 公式が認めている癖 | 対処として書かれていること |
|---|---|
| 幻覚(音声に無い文の出力) | 記載なし(限界として提示) |
| 同じ文言の繰り返し | ビームサーチ・温度調整で一部軽減 |
そしてもう1つ。公式は、精度の欠陥が結果に直結するような高リスクの意思決定での使用を推奨していません。文字起こしをそのまま根拠にして人や契約について判断する使い方は、モデルの作り手自身が止めています。
実務での置き方は、ここから決まります。決定事項と担当と期日は、必ず音声に戻って確かめる。それ以外の背景説明は多少ずれていても実害が小さい。全部を疑うのではなく、疑う場所を決めるほうが続きます。
録音してよいかどうかは、Whisperの外の話です
公式モデルカードに、道具の作り手からの注意があります。本人の同意なく録音された個人の音声の文字起こしにWhisperを使うことに反対する、というものです。これは法律の判断ではなく、OpenAIが利用者に向けて書いた注意喚起です。Whisperの公式資料にこう書かれている、という事実として読んでください。
そのうえで、実務で効く順番があります。会社の情報管理規程、相手先の会議室の規則、業界ごとの取り決め——これらはWhisperのライセンスとは無関係に効きます。MITライセンスはソフトウェアの利用と再配布の話であって、録音してよいかを決めるものではありません。
| 決めること | ローカルで動かす場合の論点 |
|---|---|
| 誰が録るか | 個人の判断に委ねると規程から外れる |
| どこに置くか | 個人のパソコン=暗号化もバックアップも自前 |
| いつ消すか | 自動で消えないので手で消す運用が要る |
社内で運用に載せるなら、決めておく項目はこの3つです。ローカルで動かす場合は保存先が個人のパソコンになるので、退職時や機材の入れ替え時に音声がどうなるかまで決めておかないと、外に出さないために手元へ置いたはずのものが、管理されない場所に残ります。
APIを使う場合は、OpenAI側は保持なしと公式に書かれているぶん、消す運用の対象は手元のファイルだけになります。どちらが楽かは、組織の作りによります。
この記事では法的な結論は書きません。録音の可否や記録の扱いについての個別の判断は、弁護士にご確認ください。実務としては、録ることを先に伝えるほうが結局は速い、とだけ書いておきます。
どこまでを自分でやるか
Whisperは文字起こしのエンジンであって、議事録の道具ではありません。ここを分けて考えると選びやすくなります。
録って、文字にして、要点を整理して、宿題を拾う——この4つのうち、Whisperが引き受けるのは2つ目だけです。残りを自分でやる時間と、月額を払って任せる金額を、天秤にかけることになります。無料でどこまで行けるかの全体像はこちら、音声を外に出さないという条件で選ぶ場合はこちらにまとめています。
「無料」の内訳を分解する
MITライセンスで無料なのは、コードとモデルの重みの利用料です。ここは公式にはっきり書かれています。ではローカルで動かすとき、何が無料でなくなるのか。
| かかるもの | 内容 |
|---|---|
| 利用料 | かからない(MITライセンス) |
| 機材 | GPUが無いとCPUで待つことになる |
| 保存領域 | large でモデルだけで2.9 GiB |
| 時間 | 導入と、実行のたびの待ち時間 |
時間の目安は、前に出した実測から立てられます。CPUのみ・smallで13分の音声に6分58秒なので、単純に比例させると1時間の会議で約32分。これを毎回待つか、GPUのある機材を用意するかの選択になります。
導入の時間も一度きりではありません。Pythonのバージョンが上がる、PyTorchが入れ替わる、ffmpegのパスが変わる——手元の環境が動くたびに面倒が発生します。動かし続けるコストは、最初に入れるコストより読みにくい部分です。
一方で、量が多いときの強さは本物です。分数の上限も本数の上限も無いので、月に100時間の音声を処理しても追加の請求は発生しません。API側なら同じ100時間で36米ドルです。金額としては大きくありませんが、上限を気にせず回せることは運用上の違いになります。
判断の材料は、結局この2つに絞られます。待ち時間を許容できるか。環境を維持する担当がいるか。
立場で分ける——誰が使うべきか
冒頭の分け方(ローカルかAPIか)に、もう一段の軸を足します。何のために使うか、です。
| 立場 | 向くか | 理由 |
|---|---|---|
| 開発者・研究者 | 向く | MITライセンス。改造も再配布もできる |
| 情シスで内製したい | 条件つき | 話者分離と運用設計を自分で作ることになる |
| 会議の議事録が欲しい | 向かない | 文字にするところで止まる |
| 声でメモを書きたい | 別の道具 | ディクテーション用のアプリが速い |
もう1つ、使い方の側からも並べます。
| 使い方 | 判断の材料 |
|---|---|
| 音声を外に出せない | ローカル版が数少ない選択肢になる |
| 量が多い(月に何十時間) | 分数の上限が無いのは大きい |
| 月に数本だけ | 環境構築の手間が回収できない |
| 誰が話したか要る | Whisper単体では届かない |
判断が割れるのは、この表の真ん中の2行です。月に何十時間も文字起こしをするなら、ローカル版なら電気代だけで済みます。逆に月に2〜3本なら、pipとffmpegとモデルの重みを用意する時間のほうが高くつきます。
続くかどうかの観点もあります。Whisperは録るたびにファイルを渡す道具なので、会議の直後に自分でコマンドを打つ手順が毎回発生します。週に1本なら成立します。毎日3本あると、たいてい止まります。
そして2027年2月26日の期限は、API側だけに効きます。APIで組んだ仕組みは移行の予定を立てることになり、ローカルで組んだ仕組みは影響を受けません。長く使うつもりなら、ここは効きます。
公式に記載を確認できなかったこと
肯定でも否定でもなく、確認できなかった項目を並べます。ここを埋めた記事は、たいてい推測が混ざっています。
| 項目 | 状態 |
|---|---|
| 日本語のWER/CERの具体的な数値 | 確認できず(グラフに数値ラベルが無い) |
| Mac・Windowsでの処理時間 | openai/whisper公式にはA100の相対値のみ |
| 円建ての定価 | 日本語の料金ページも米ドル表示 |
| 年払いの割引 | 月額・年額という区分が公式に無い |
| 項目 | 状態 |
|---|---|
| 解約の手順 | 従量課金のため該当ページを確認できず |
| 通常購入の返金条件 | 不正利用の相談窓口のみ確認 |
| ISO 27001 の登録番号 | 証明書は申請が必要で公開ページに無し |
| 専用の本体機器・価格 | ソフトウェアのため該当なし |
| 項目 | 状態 |
|---|---|
| turbo のパラメータ数 | README 809 M / モデルカード 798 M で食い違い |
| API上限が 25 MB か 25 MiB か | 英語版は MB、日本語ヘルプは MiB |
| API版の最大再生時間 | サイズの上限の記載のみ |
| docx / pdf の書き出し | 選択肢に無いが「非対応」の明記は確認できず |
25MBと25MiBの食い違いは、実務では約1.2MBの差になります。両方を同じ数字として並べないでください。どちらを基準にするかで、出典を揃える必要があります。なお日本語ヘルプのページには機械翻訳である旨の注記があります。
Web会議(Zoom・Teams・Google Meet)へ参加して録音するボット機能についても、公式リポジトリ・モデルカード・APIドキュメントのいずれにも記載を確認できませんでした。Whisperはモデルであってサービスではないので、そもそも該当する機能が無いと読めますが、「無い」と明示した公式の記述は見つかりませんでした。
同じ理由で、GUIアプリやスマートフォンアプリも公式の提供物ではありません。READMEは第三者による移植やWebデモの存在に触れていますが、それらはOpenAIが配っているものではなく、動作も更新も各プロジェクトの責任です。
仕様は2026年9月2日時点の公式サイトの表示です。確認したのは GitHub の openai/whisper リポジトリ(README・モデルカード・ソースコード)、developers.openai.com の各ガイド、help.openai.com の日本語ヘルプ、openai.com の日本語の料金ページとサービス契約、trust.openai.com、および faster-whisper と whisper.cpp の各公式リポジトリです。内容は変わることがあるので、使う前に公式でご確認ください。
他の選択肢と並べた比較は文字起こしアプリの比較にまとめました。手元で動かす方式は、時間の制限がない側に入ります。
仕様は2026年9月2日時点の公式リポジトリ(github.com/openai/whisper)とOpenAIのAPIドキュメントの記載です。内容は変わることがあるので、使う前に公式でご確認ください。
よくある質問
Whisperは無料ですか
手元で動かすほうは無料です。コードとモデルの重みの両方がMITライセンスで公開されています。ただしOpenAIのAPI経由でWhisperを使う場合は有料で、音声はOpenAIへ送られます。同じ名前でも別物です。
Whisperで話者は分かれますか
分かれません。公式リポジトリに話者分離(diarization)の記載はありません。誰が話したかを分けたい場合は pyannote などの別のライブラリを組み合わせることになります。なお、OpenAIのAPI側には gpt-4o-transcribe-diarize という話者分離に対応したモデルがあります。
Whisperを動かすには何が要りますか
公式の案内では Python 3.8〜3.11、PyTorch、ffmpeg です。プログラムを書かずに使いたい場合は、whisper.cpp を土台にしたGUIアプリ(MacWhisperなど)を使う道があります。
日本語の精度はどれくらいですか
公式リポジトリに言語別の図はありますが、日本語の具体的な数値の記載は見つけられませんでした。モデルの大きさで結果が変わるので、自分の音声で試すのが確実です。
WhisperのAPIはいくらですか
whisper-1 は音声1分あたり0.006米ドルです。1時間の会議で0.36米ドル、月20本なら7.20米ドルの計算になります。公式の価格表示は米ドルで、円建ての定価は日本語の料金ページでも確認できませんでした。日本の利用者には10%の日本の消費税(JCT)が別途請求されます。
whisper-1 はいつ使えなくなりますか
OpenAIは2026年8月26日に非推奨を通知し、2027年2月26日にAPIから削除すると告知しています。推奨される移行先は gpt-live-transcribe または gpt-transcribe です。話者分離ができる gpt-4o-transcribe-diarize も同じ日に削除されます。なおGitHubで配布されているオープンソース版のWhisperは、この告知の対象ではありません。
Whisperは商用利用できますか
コードとモデルの重みの両方がMITライセンスで公開されていると公式に記載があります。ライセンス料は発生しません。ただしMITライセンスはソフトウェアの利用と再配布の話であって、録音してよいかどうかを決めるものではありません。社内規程や相手先の規則は別に効きます。個別の判断は弁護士にご確認ください。
Whisperでリアルタイム文字起こしはできますか
できません。公式モデルカードに「Whisperのモデルはそのままではリアルタイムの文字起こしには使えない」と明記されています。API版の whisper-1 もストリーミング(逐次出力)に対応しないと日本語の公式ヘルプが記載しています。リアルタイムが要るなら gpt-live-transcribe という別のモデルがあり、単価は1分0.017米ドルです。
WhisperのAPIに送った音声は学習に使われますか
2023年3月1日以降、明示的にオプトインしない限り学習や改善には使われないと公式ドキュメントに記載があります。文字起こしのエンドポイントは、不正利用監視のログ保持もアプリケーション状態の保持も「None」と公式の表に書かれています。なお、手元で動かす場合は音声がOpenAIのサーバーを経由しません。
1時間の会議を処理するのにどれくらい時間がかかりますか
openai/whisper の公式資料にはA100というデータセンター向けGPUでの相対値しかなく、MacやWindowsでの実測値を確認できませんでした。派生プロジェクトのfaster-whisperが公表している実測では、13分の音声をCPUのみ(i7-12700K・8スレッド・small)で処理すると openai/whisper は6分58秒です。単純に比例させると1時間の会議で約32分になります。
turbo と large はどちらを選べばいいですか
文字起こしだけなら turbo です。large-v3 を速度向けに最適化したもので、精度の低下はわずかと公式が説明しています。ただし turbo は翻訳タスクの学習を受けていないため、英語へ翻訳したい場合は medium か large を使う必要があると公式READMEに記載があります。
Whisperは日本国内で処理されますか
API版では処理されません。日本は保管地域(jp.api.openai.com)としては選べますが、公式ガイドの地域表で日本は「Regional storage: Yes / Regional processing: No」です。音声のエンドポイントの処理地域は米国と欧州(EEA+スイス)だけと記載されています。手元で動かす場合は、そもそも音声が外に出ません。
オフラインで文字起こしと議事録はできるか
「安全です」と書かないことにした——うちのセキュリティの考え方
文字起こしを無料でやる方法と、無料で足りなくなる線
話者分離が外れる2つの壊れ方。片方は直せて、片方は直せない