Recory ノート ダウンロード
選び方と比較

ACES Meet——話者の声を貯めて識別精度を上げる、という設計

東大松尾研発のACESが出しているAI議事録ツールです。特徴は「話者ごとの声の特徴を蓄積・照合する特許技術」で、使うほど誰が話したかの識別が正確になるという作り。この分野で最も崩れやすい部分に正面から取り組んでいますが、裏返しの論点もあります。

株式会社ACESが出しているAI議事録ツールです。東京大学松尾研究室発の会社で、公式サイトもそこを前面に出しています。この分野の製品を並べたとき、この製品だけが違う方向を向いている部分があります。話者識別への取り組み方です。話者識別は文字起こしとも要約とも別の処理で、どこが独立しているかはAI議事録とは何かに整理しました。

話者識別を、蓄積で解く

AI議事録でいちばん壊れやすいのが話者分離です。5人で話した会議が3人にまとめられる、途中から入った人が既存の話者に吸収される、といった崩れ方は製品を問わず起こります。原因は単純で、多くの製品がその1回の音声だけを手がかりに分けようとするからです。声質が近い2人がいれば、区別する材料がありません。

ACES Meetは、ここに別の解き方を持ってきています。公式の説明は「利用するほど、話者ごとの声の特徴を蓄積し、照合に活用。継続的に識別精度が向上し、発言の整理がより正確になります」で、これを特許技術としています。1回の音声で分けるのではなく、その人の声の特徴をあらかじめ持っておいて照合する、という作りです。

その回の音声だけで分ける多くの製品声質が近いと崩れる声の特徴を貯めて照合するACES Meet繰り返す相手に強い
話者識別の解き方は、大きく2つに分かれます。

この設計が効くのは、同じ顔ぶれが繰り返し出る会議です。社内の定例、担当が固定された取引先との商談、毎週の1on1。こういう会議では、蓄積が効いて識別が安定していく方向に働きます。逆に、毎回はじめての人が入る会議——採用面接や大人数のセミナー——では、蓄積の効果は出にくいはずです。

固有名詞と業界用語についても同じ考え方が使われています。辞書に登録すると音声認識モデルが継続的に学習し、誤変換を減らすと説明されています。社内用語が多い会議ほど、この機能の価値は高くなります。

裏返しの論点——声紋を貯めるということ

強みの説明をしたので、裏側も書きます。「話者ごとの声の特徴を蓄積する」というのは、声紋のデータを貯めるということです。

これ自体は珍しい技術ではありませんし、識別精度を上げるためには合理的な設計です。ただし記録の対象には、自社の社員だけでなく取引先の担当者や、面接に来た人も含まれます。その人たちの声の特徴が事業者側に蓄積されることについて、社内でどう扱うかは決めておいたほうがいい論点です。

もう一点、公式サイトの説明からは読み取れなかったことがあります。蓄積された声の特徴が、自社のテナント内だけで使われるのか、それとも全体の音声認識モデルの改善にも使われるのかが書かれていません。「使えば使うほど学習し、社内専用AIに進化」という表現からは前者に読めますが、明示はされていません。議事録が学習に使われるかどうかの確認の仕方は別の記事にまとめてありますので、導入前にこの点を問い合わせる価値があります。

これは欠点の指摘ではありません。蓄積で精度を上げる設計を選んだ以上、必ず出てくる論点だというだけのことです。他社の「その回だけで分ける」設計は、この論点を持たない代わりに、精度が上がっていく仕組みも持ちません。どちらを選ぶかは、会議の顔ぶれと社内の規定で決まります。

精度は、相対値で示されています

公式サイトにある精度の表現は「LLM技術を応用した音声認識モデルに比べて、文字起こしの修正が必要な箇所は約40%削減」というものです。ここには読み方の注意が2つあります。

1つは、比較対象が明示されていないことです。「LLM技術を応用した音声認識モデル」がどれを指すのかは書かれていません。この分野には得意・不得意の出方が違うエンジンが複数あり、どれと比べたかで数字は変わります。

もう1つは、絶対値ではないことです。修正が必要な箇所が40%減ったというのは、元がどれだけあったかによって意味が変わります。他社が掲げる「精度98%」のような数字とは、そもそも比べられません。この分野の精度の数字が何を測ったものかは、製品ごとに違います。

とはいえ、「修正が必要な箇所」を指標に置いていること自体は、実務に近い測り方です。利用者が本当に知りたいのは正解率ではなく、そのまま共有できるかどうか、直す手間がどれだけ残るかです。公式も「議事録を"そのまま共有できる"精度」という言い方をしています。書き起こしのあとにフィラーや言いよどみの除去、表現の正規化、句読点の処理をかけるとも説明されていて、素起こしから整文までのどこを担うかがはっきりしています。

商談の記録に寄せた作りです

導入事例に並んでいるのが営業とセールス・イネーブルメントの文脈に偏っていて、機能もそちらに寄っています。

機能説明
Salesforce連携商談内容をAIが整理し、Salesforceの項目へ自動反映
APICRMや社内の独自システムと柔軟にデータ連携
スマホアプリ1タップで録音・解析。対面の商談に対応
辞書登録固有名詞・業界用語を登録して誤変換を削減

商談の記録を、そのまま次の行動につなげるという設計です。商談の議事録に何を残すと次が楽になるかは商談記録の書き方にまとめていますが、そこで挙げている項目の多くは、SFAの入力項目とほぼ重なります。人がやると面倒な転記を自動化する、という発想は理にかなっています。

導入事例で挙げられている数字には「議事録作成の工数を7〜8割削減」「録画取得率が10%未満から95%超に」といったものがあります。後者は精度の話ではなく、そもそも記録が残るようになったという話で、実務ではこちらのほうが効くことがあります。

公式が数字を出していない項目

2026年9月1日時点で、公式サイトに記載を確認できなかったのは次です。

項目状態
料金非公開(資料請求・問い合わせ)
無料トライアルの期間と条件実施中とあるが、条件の記載なし
セキュリティ認証(ISO27001等)記載を確認できず
文字起こしの絶対精度相対値のみ
対応言語記載を確認できず
データの保管場所・保管期間記載を確認できず
蓄積した声の特徴の扱いテナント内限定かどうかの記載なし

セキュリティについては「ACES Meetはセキュリティー対応を最優先事項として捉えています。必要に応じて貴社のセキュリティーポリシーに準拠するべく対応いたします」という記載があります。個別に対応する構えだと読めますが、認証を取得しているかどうかは別の話です。社内の規定でISO27001が条件になっているなら、認証を明記しているサービスと並べて検討することになります。

向く場面・向かない場面

向く

  • 同じ顔ぶれの会議が繰り返しある。声の蓄積が効くのはこの条件です
  • 「誰が言ったか」が業務上重要。話者識別に正面から取り組んでいる数少ない製品です
  • Salesforceを使っている。商談の内容を項目へ自動反映する連携があります
  • 社内用語・業界用語が多い。辞書登録が継続的に学習に反映されます
  • 対面の商談が中心。スマホアプリで対応しています

向かない

  • 価格を先に知って比較したい。料金が公開されていません
  • 毎回はじめての人が入る会議が中心。蓄積による精度向上は効きにくいはずです
  • 声のデータを事業者に貯めることに社内の合意が取れない。設計の中心がここにあります
  • ISO27001の取得が導入の条件。認証についての記載を確認できませんでした
  • 個人で使いたい場合。法人向けの作りで、価格も問い合わせ前提です

内容は2026年9月1日時点の公式サイト(meet.acesinc.co.jp)の記載です。変わることがあるので、契約前に公式でご確認ください。

よくある質問

ACES Meetの料金はいくらですか

公式サイトに料金の記載はありません。資料請求か問い合わせで確認する形です。無料トライアルは実施中と案内されていますが、期間や条件は公式サイト上に記載がありません。

対面の会議でも使えますか

使えます。スマートフォンアプリが用意されていて、公式は「1タップで簡単録音・解析」と説明しています。オンラインと対面の両方に対応することを、トップページの見出しに掲げています。

話者識別の仕組みは何が違うのですか

話者ごとの声の特徴を蓄積して照合する特許技術を使っていると説明されています。継続して使うほど識別の精度が上がる、という設計です。多くの製品は1回の音声だけで分けようとするので、そこが構造的に違います。

文字起こしの精度はどれくらいですか

数字としての精度は公表されていません。公式にあるのは「LLM技術を応用した音声認識モデルに比べて、文字起こしの修正が必要な箇所は約40%削減」という相対的な表現です。比較対象となったモデル名は記載がありません。

セキュリティの認証は取得していますか

ISO27001などの認証について、公式サイトに記載を確認できませんでした。「必要に応じて貴社のセキュリティーポリシーに準拠するべく対応いたします」という記載があります。認証が導入の条件になっている場合は、問い合わせて確認してください。

無料で3会議ためす登録もカードも不要・iPhone専用 試す