2026年におすすめの音声認識モデル5選:テストとランキング


同じ過酷なテストセットで5つの音声認識(Speech-to-Text)モデルを検証しました。8kHzの実際の通話音声40時間分で、なまりのある名前、口頭で読み上げる証券番号、走行中の車からのスピーカーフォン通話、そして二人が同時に話す場面などが含まれています。私は自作の正解データに対する単語誤り率、最初の部分結果と確定までのレイテンシ、そして取引を左右する言葉を各モデルがどう扱うかを測定しました。
世界の音声認識市場は2026年時点で約38.7億ドルに達しており、その支出の大半は今やほんの一握りのモデルに集中しています。
音声プロダクトを構築する人なら、すでに落とし穴をご存じでしょう。機能デモはオフィスではきれいに動きますが、本番音声に触れると最も重要な一語を取りこぼし、エージェントが誤った日付を予約したり、誤った口座を読み上げたりします。
このガイドでは、そのテストを生き残ったモデルをランク付けし、精度・レイテンシ・言語・価格を比較し、それぞれが実際の音声スタックの中でどう役立つかを示します。
| 機能 | AssemblyAI Universal-3 Pro | Retell AI | Deepgram Nova-3 | OpenAI gpt-4o-transcribe | ElevenLabs Scribe v2 |
|---|---|---|---|---|---|
| 最適な用途 | 最高精度の非同期文字起こし | エンドツーエンドのライブ音声エージェント | 大規模での低レイテンシストリーミング | 多言語エコシステムとの適合 | リアルタイム多言語 |
| 価格 | 非同期で$0.21/時 | オールインのエージェントで$0.07/分 | バッチ$0.0043/分、ストリーム$0.0077/分 | $0.006/分、mini $0.003/分 | 従量課金、約$0.22/1Kトークン |
| 文字起こし精度(WER) | 平均5.6%、中央値4.9% | エンジン依存 | 5.26% | 独立検証で約8.9% | 多言語ベンチマークで首位 |
| リアルタイムレイテンシ | 確定まで約760ms | 往復全体で約600ms | 300ms未満 | 最初のチャンクで500〜1500ms | 最初の部分結果で約150ms |
| ストリーミングSTT | 対応、Universal-3 RT Pro | 対応、エージェントに内蔵 | 対応、ネイティブに加えFlux | 限定的、Realtime API経由 | 対応、Scribe v2 Realtime |
| 言語 | 約20、コア6言語でコードスイッチング | 31以上 | ストリーミング約10、バッチ36 | 99以上 | 90以上 |
| 音声エージェント対応 | STTのみ、LLM/TTSと組み合わせ | ターンテイキング付きの完全なエージェント | STTに加えFluxのターン検出 | リアルタイムのスピーチトゥスピーチ | STTに加えAgentsプラットフォーム |
| 話者分離 | 対応 | テレフォニー層で処理 | 対応、別料金 | 対応、diarizeバリアント | 対応、話者精度98% |
| コンプライアンス | SOC 2、HIPAA BAA | SOC 2 Type II、HIPAA BAA、GDPR | SOC 2、HIPAA、セルフホスト | SOC 2、ゼロ保持オプション | SOC 2、ISO 27001、PCI DSS、HIPAA |
| 無料クレジット | $50 | $10 | $200 | $5 | 無料プラン |
データは公式製品ページおよび2026年6月時点の実地テストに基づいています。
音声認識モデルは、音響信号から最も可能性の高い単語列を予測することで、話された音声を書き起こしテキストに変換します。誰もが引用する指標が単語誤り率であり、これは人間の参照に対して置換・挿入・削除された単語の割合です。今やニューラルモデルがこのカテゴリを支配しており、カスタマーサービスやIVRではアップグレードというよりむしろ標準仕様となっています。この変化はより広範なニューラル音声の導入データ全体に見て取れます。
購入者がつまずくポイントは、そのモデルが何のためのものかという点です。文字起こしモデルはテキストを返します。音声エージェントはリアルタイムで聞き、理解し、応答しなければならず、つまりモデルはLLM、音声、ターンテイキングも必要とするパイプラインの一段階にすぎません。前者のグループは精度と価格を重視します。後者のグループはループ全体にわたるレイテンシで生死が決まります。
以下の各モデルは、同じテストセットを用いて同じ5つの基準で採点しました。マーケティングページが約束することではなく、私が測定した内容と各モデルがどこで破綻したかを報告します。並び順は、それぞれのツールが構築された目的を反映しています。
何ができるのか? ノイズの多い音声、なまりのある音声、専門的な音声で高精度の文字起こしを返す、プロンプト可能な音声言語モデルです。
誰に向いているのか? 名前、数字、専門用語を正確に取得できるかどうかにプロダクトが依存しているチーム。
| カテゴリ | スコア |
|---|---|
| 文字起こし精度 | 9.8/10 |
| リアルタイムレイテンシ | 8.0/10 |
| 多言語サポート | 7.5/10 |
| 本番稼働の準備状況 | 9.0/10 |
| セットアップの容易さ | 9.0/10 |
| 総合 | 9.4/10 |
私はUniversal-3 Proに、発信者が背景ノイズの中で口座番号を読み上げる債権回収通話のバッチを与えたところ、私のセットで4.7%の単語誤り率を返し、テストしたどのモデルよりも低い値でした。薬名や用量を含む臨床録音では、その医療対応が他のモデルが近似した用語を正確に捉え、AssemblyAIが約7%のライバルに対して公表している約4.9%の医療エンティティ誤り率と一致しました。
驚いたのはプロンプトでした。文字起こしの前にプレーンな英語のコンテキストを渡し、スペイン語と英語の混在パッセージを保持するよう指示したところ、翻訳を強制する代わりに各フレーズを元の言語のまま保持しました。
難しい入力でのその精度は、なまりのある音声や非ネイティブ音声のどれだけ多くの非流暢さが今なお弱いモデルを苦しめるかを示すなまり音声の研究と一致しています。
難点はレイテンシです。Universal-3 Proは非同期優先で、新しいRT Proがストリーミングに対応させたものの、ライブ音声での確定までの時間は約760msで、ホットパスの音声エージェントにはDeepgramより遅いです。録音ファイル、ポッドキャスト、通話後分析には、精度のリーダーです。
長所
短所
価格 Universal-3 Pro非同期で1時間あたり$0.21、ボリュームディスカウントあり、レート制限なし。リアルタイムストリーミングはUniversal-3 RT Proで別途課金されます。
何ができるのか? 音声認識、LLM、音声、独自のターンテイキングを、電話に応答して行動する一つのエージェントとして実行するプラットフォームです。
誰に向いているのか? 本当の目的が生のトランスクリプトではなく、実際に動く電話エージェントであるチーム。
| カテゴリ | スコア |
|---|---|
| 文字起こし精度 | 9.0/10 |
| リアルタイムレイテンシ | 9.5/10 |
| 多言語サポート | 8.5/10 |
| 本番稼働の準備状況 | 9.5/10 |
| セットアップの容易さ | 9.5/10 |
| 総合 | 9.3/10 |
ここではトランスクリプトのテストをやめ、成果をテストしました。私は4問のインテークを行い、枠を予約し、すべての通話を通話後分析に採点済みトランスクリプトと抽出フィールドとしてログする、インバウンドエージェントを構築しました。音声から音声応答までの往復全体は約600msで測定され、2人のテスト発信者がAIと話していることに気づかないほど高速でした。
これと生のSTT APIとの差はリカバリーとコンテキストに現れました。企業のナレッジベースを接続することで、すべての分岐をスクリプト化しなくてもエージェントがポリシーに関する質問に答えられ、一方で独自のターンテイキングは発信者が文の途中で割り込んだときのバージインを処理しました。
モデルが聞き、システムが判断し、間が気まずくなる前にエージェントが応答しました。
文字起こしのみのスタックを破綻させるエッジケースが、フロー内で処理されました。発信者が混乱したとき、エージェントは発信者を放り出す代わりに、会話コンテキストを完全に引き継いだウォームな通話転送を実行しました。Medical Data Systemsは、これをインバウンド通話の100%で運用し、転送率はわずか30%で、月あたり約$280,000を回収しています。
長所
短所
価格 エージェントは1分あたりオールインで$0.07、プラットフォーム料金なし、$10の無料クレジット付き。この1分に音声認識、LLM、音声、テレフォニーがすべて含まれます。
何ができるのか? ライブ音声で300ms未満のトランスクリプトを実現するよう設計された、ストリーミング優先の音声認識モデルです。
誰に向いているのか? レイテンシが最重要KPIであり、通話量が多いエンジニアリングチーム。
| カテゴリ | スコア |
|---|---|
| 文字起こし精度 | 9.0/10 |
| リアルタイムレイテンシ | 9.5/10 |
| 多言語サポート | 7.0/10 |
| 本番稼働の準備状況 | 9.0/10 |
| セットアップの容易さ | 8.5/10 |
| 総合 | 9.0/10 |
同じライブ通話音声をNova-3にストリーミングしたところ、一貫して300ms未満で部分トランスクリプトが返ってきました。これはグループ内で最速の純粋STT結果です。クリーンな英語では独自の実環境セットで5.26%の単語誤り率を報告し、私のノイズの多い音声でもAssemblyAIから2ポイント以内に収まりつつ、単語をはるかに早く返しました。
秒単位の課金は短い発話で役立ちました。一語の「hello」が切り上げられたブロックではなく1秒として課金され、これはおしゃべりなエージェント通話全体で積み重なります。
DeepgramはさらにFluxを提供しています。これはターン終了検出を内蔵した別モデルで、ボットが割り込むのを止めるための音声活動検出を後付けする必要がありませんでした。
トレードオフは幅広さです。Nova-3ストリーミングはOpenAIやElevenLabsの広範なカバレッジに対して約10言語をカバーし、話者分離はアドオンとして課金されます。何よりも速度を必要とする英語優先の音声エージェントには、ホットパスでのデフォルトエンジンです。
長所
短所
価格 従量課金でバッチ1分あたり$0.0043、ストリーミング1分あたり$0.0077、$200の無料クレジット付き。音声エージェント向けのFluxは1分あたり$0.0065から。
何ができるのか? 99以上の言語で従来のWhisperをより低い誤り率で置き換える、GPT-4oベースの文字起こしモデルです。
誰に向いているのか? すでにOpenAI上で構築しており、文字起こしとLLM作業を一つのベンダーで済ませたいチーム。
| カテゴリ | スコア |
|---|---|
| 文字起こし精度 | 8.7/10 |
| リアルタイムレイテンシ | 6.5/10 |
| 多言語サポート | 9.0/10 |
| 本番稼働の準備状況 | 8.0/10 |
| セットアップの容易さ | 9.0/10 |
| 総合 | 8.3/10 |
Whisperのパイプラインをモデル文字列を一つ変えるだけでgpt-4o-transcribeに切り替えたところ、私の多言語セットでの単語誤りが顕著に減り、OpenAIが報告するクリーンなベンチマークでの4.1%と一致しました。
より難しいテレフォニー音声では、独立したベンチマークが報告する約8.9%に近い結果となり、これがスタジオと現場との差です。
真の勝ちどころは言語とシンプルさです。1分あたり$0.006、$0.003のminiティア付きで、別のプロバイダーを探し回ることなく99以上の言語を処理し、diarizeバリアントは2者間通話で専用ツールと1〜2ポイント以内の差で話者を識別しました。
音声エージェントにとっての弱点はストリーミングです。ネイティブの文字起こしはバッチ優先で、リアルタイムには別のRealtime APIへの移行が必要となり、私の最初のトランスクリプトチャンクは500〜1500msで到着しました。OpenAIスタック内の録音済み多言語コンテンツには、簡単な選択肢です。
長所
短所
価格 gpt-4o-transcribeは1分あたり$0.006、miniは$0.003、リアルタイム文字起こしは1分あたり約$0.017。
何ができるのか? 90以上の言語にわたって低レイテンシのトランスクリプトを提供する、ストリーミング優先の音声認識モデルです。
誰に向いているのか? エージェントやライブキャプション向けに、多くの言語で高速かつ正確な文字起こしを必要とするビルダー。
| カテゴリ | スコア |
|---|---|
| 文字起こし精度 | 8.8/10 |
| リアルタイムレイテンシ | 9.0/10 |
| 多言語サポート | 9.5/10 |
| 本番稼働の準備状況 | 8.0/10 |
| セットアップの容易さ | 8.5/10 |
| 総合 | 8.6/10 |
ライブ音声をScribe v2 Realtimeにストリーミングしたところ、約150msで最初の部分結果が返ってきました。これはグループ内で最速の最初のトークン結果で、予測的な文字起こしが次の単語を先読みしていました。
英語、スペイン語、ヒンディー語のクリップの組み合わせで、弱いモデルがぶれるところでも精度を保ち、手動のセグメンテーションなしに単一ファイル内の言語の切り替えを自動検出しました。
話者ラベリングは多者テーブルで感心させられ、ターンをきれいにタグ付けし、秘匿化のためにエンティティにタイムスタンプを付けました。キータームのプロンプトで最大1000フレーズを製品名や薬名へと誘導でき、ブランド用語での誤りを減らしました。
制約はコールセンターの基盤としての成熟度です。非英語音声でのリアルタイム話者分離はまだ粗く、本番ツールはDeepgramより若いです。速度と言語の幅の両方が重要な多言語リアルタイム文字起こしには、最も強力な専門家です。
長所
短所
価格 音声1分あたりの従量課金で、Scribe v2は最近の値下げ後、エントリーティアで1,000トークンあたり約$0.22、開始用の無料プラン付き。
公表されるWERは通常クリーンな録音から得られ、ベンチマークで5%のモデルがノイズの多い通話では15〜20%に達することもあります。私は自作の8kHz通話セットですべてのモデルを採点し、独立したベンチマークと相互検証したので、ランキングはリーダーボードではなく本番の現実を反映しています。
文字起こしでは、確定までの時間が数値です。音声エージェントでは、重要なのは音声から音声応答までの往復全体です。なぜなら1秒を超えるものはトランシーバーのように感じられるからです。会話型のユースケースにはストリーミングレイテンシを重く重み付けしました。
英語で勝つモデルが、なまりのある通話や混合言語の通話で崩れることがあります。スペイン語と英語、そしてヒンディー語の音声をテストしました。なぜなら、音声認識市場全体でカスタマーサービスにおいてニューラル音声が今やデフォルトであり、発信者は単一言語にとどまらないからです。
最も深い基準はスコープでした。生のモデルはテキストを提供し、LLM、音声、ターンテイキングは自分に任せます。プラットフォームはエージェントを提供します。私は各ツールを、購入者がそれを雇う目的に照らして採点しました。だからこそランキングは文字起こしリーダーとエージェントプラットフォームを分けています。
モデルはテキストを提供します。ビジネスには、通話に応答し、質問を解決し、予約を取ることが必要です。ここで挙げた5つのモデルは、文字起こしがあなたのプロダクトであれば正しい出発点であり、AssemblyAI、Deepgram、OpenAI、ElevenLabsはそれぞれ明確なレーンで勝っています。
もしあなたの目標が、聞き、理解し、約600msの一つのループで行動する電話エージェントであれば、モデルの上のレイヤーが必要です。Retell AI は音声認識、あなたが選んだLLM、超リアルな音声、独自のターンテイキングを、プラットフォーム料金なしで単一の本番エージェントとして実行し、$10の無料クレジットが付きます。
今日から無料で最初のAI音声エージェントの構築を始めましょう。
2026年に音声認識モデルを選ぶことは、一つの率直な問いに行き着きます。モデルがテキストを生成した後、そのテキストはどうなるのか?もし人が後でトランスクリプトを読むなら、精度と価格が勝者を決め、非同期リーダーは打ち負かすのが難しいです。もし機械が発信者を聞き、意図を理解し、沈黙が気まずくなる前に応答しなければならないなら、モデルはより長い連鎖の最初の環にすぎず、ループ全体にわたるレイテンシがどの単一のベンチマークよりも重要になります。
信頼できる音声プロダクトを出荷するチームは、その区別を早くに行います。彼らは、クリーンなスタジオサンプルではなく、ノイズの多い回線やなまりのある名前を含む、ユーザーが実世界で生み出す音声でテストします。彼らは部分トランスクリプトではなく往復全体を測定します。そして、コンポーネントを買うのか成果を買うのかを最初に決めます。その決定を正しく行えば、候補リストは自ずと狭まります。難しかったのはモデルではありません。それは、どの仕事のためにそれを雇っているのかを知ることでした。
2026年に単語誤り率が最も低い音声認識モデルはどれですか?
AssemblyAI Universal-3 Proが精度をリードし、平均WER 5.6%を報告し、私のノイズの多い通話セットで4.7%と最低の誤りを記録しました。Deepgram Nova-3は独自の実環境セットで5.26%と続き、単語をはるかに速く返します。
音声認識モデルが必要ですか、それとも完全な音声エージェントプラットフォームが必要ですか?
録音ファイルのトランスクリプトだけが必要なら、生のモデルの方が安価でシンプルです。発信者を聞いてリアルタイムで応答するシステムが必要なら、モデルの上のレイヤーが必要です。だからこそAI IVRの置き換えは、STT、LLM、音声、ターンテイキングを一緒に実行します。
ライブ音声エージェントに最速の音声認識モデルはどれですか?
ElevenLabs Scribe v2 Realtimeは私のテストで約150msで最初の部分結果を返し、Deepgram Nova-3は確定までの時間で300ms未満を保ちました。聞く・判断する・応答するループ全体では、Retellはエンドツーエンドで約600msを測定しました。この数値には文字起こしだけでなくLLMと音声応答が含まれるためです。
大規模で音声認識モデルは1分あたりいくらかかりますか?
Deepgramバッチは1分あたり$0.0043、OpenAI gpt-4o-transcribeは$0.006、AssemblyAI非同期は1時間あたり$0.21です。STT、LLM、音声、テレフォニーをまとめた完全なエージェントの1分は異なる単位で、1分あたり約$0.07で価格設定されています。
これらの音声認識モデルは多言語やなまりのある通話を処理できますか?
OpenAIは99以上の言語をカバーし、ElevenLabsは90以上をカバーするので、最も広範です。AssemblyAIはコア6言語にわたるコードスイッチングを処理し、なまりのある音声での精度はどのモデルでも数ポイント低下するため、自分の発信者でテストしてください。
音声認識モデルは医療通話に対応したHIPAA準拠ですか?
ほとんどのリーダーは署名済みのBAAのもとでHIPAA対応を提供しており、これにはAssemblyAI、Deepgram、ElevenLabs、そしてRetellが含まれます。最後のRetellはさらにSOC 2 Type IIとGDPRも備えています。保護対象保健情報を送信する前にBAAが締結されていることを確認し、秘匿化が含まれているか別途課金されるかを確認してください。開発者向けのセットアップの詳細はドキュメントにあります。
音声認識モデルが重要な単語を聞き間違えたらどうなりますか?
文字起こしのみのスタックでは、誤りが下流へと静かに流れてレコードを破損させます。エージェントでは、リカバリーロジックが口頭の数字を再確認したり、ウォームトランスファーをトリガーしたりできます。だからこそ本番の音声チームは、モデルが常に正しいと仮定するのではなく、誤認識を想定して設計します。
AI搭載の音声エージェントに切り替えることで、あなたのビジネスがどれだけ節約できるかをご確認ください。
Total Human Agent Cost
AI Agent Cost
Estimated Savings
Retell クリニックオフィスのデモ電話番号

Start building smarter conversations today.




