vCX-Hardをご紹介します。これは、実際のコンタクトセンター通話で主要モデルをランク付けするRetellのベンチマークであり、音声エージェントが成功するかどうかを左右する2つの能力、すなわち事実に基づき続けること、そして正しいアクションを取ることを測定します。独自の本番通話データから構築されたvCX-Hardは、最も重要な場面でモデルのパフォーマンスを評価します。今日の最良のモデルでも最も難しいターンで約88%しかクリアできず、これこそがモデル選択が重要である理由です。
お客様が他のどんな質問よりも多く尋ねるのは、音声エージェントにどのモデルを使うべきか、という1点です。長い間、正直な社内の答えは名前を1つ挙げて肩をすくめることでした。数百万件の実際の顧客通話を扱うプラットフォームにとって、それでは不十分です。
コールセンターのエージェントの生死を分ける能力は2つだけです。
公開ベンチマークがこの両方を同時にテストすることはまれで、ライブ電話通話の条件で行われることはほとんどありません。それができるデータは入手が困難です。1社だけの通話ログでは、自信を持ってモデルをランク付けするには多様性が足りません。Retellは、多くの業界と導入にまたがる実際で多様な本番トラフィックを、あるモデルを別のモデルから区別するのに必要な量で保有しています。それこそが信頼できるコールセンターベンチマークに必要な唯一の材料であり、ほとんどのチームが集められないものです。
名前がその内容を物語っています。小文字のvはvoice(音声)を表します。CXはcustomer experience(カスタマーエクスペリエンス)、すなわちコールセンターエージェントの日々の仕事です。Hardは手法です。私たちは実際の本番トラフィックの最も難しいターン、モデルが実際に差を見せる瞬間だけで採点します。本番通話の全分布では、ほとんどのフロンティアモデルがすでに90%をクリアしており、これは何の有用な情報も与えません。難しいスライスこそが、ベンチマークがその価値を発揮する場所です。
各ケースは手書きや合成生成ではなく、実際の本番通話から抽出されています。私たちは通話を決定づける2つの軸でモデルを採点します。
私たちは27モデルにまたがる50の構成を評価しました。本番環境の音声エージェントはレイテンシのために推論をオフにして動作するため、全体を通じて2つのビューを報告します。本番(推論オフ、ライブ通話で動作するもの)とベスト(中程度の推論、推論がどれだけ役立つかの上限)です。GPT-5.5が両方でリードし、本番で84.8%の非ハルシネーション、ベストで88.0%に達します。どのモデルも解決には程遠く、まさにそこが要点です。
私たちは2026年2月6日から5月1日までの本番通話トラフィックを、約15日ごとに30分のウィンドウでサンプリングし、過去3か月に1,000件を超える通話のあった組織から抽出しました。重要なのは、組織レベルでサンプリングしたことで、少数の高ボリュームの組織がセットを支配しないようにしました。これにより、特定の顧客に偏ることなく、実際の導入にわたって分布が幅広く保たれます。
そのトラフィックから、私たちは2つの難しいケースのセットを厳選しました。2,075ケースのハルシネーションセットと、1,514ケースのツール呼び出しセットです。各ケースは多段階のパイプラインを通じて抽出されます。軽量な事前分類器が候補ターン(数値の主張、転送前の瞬間、ツールエラー、繰り返しまたは欠落した呼び出し)にフラグを立て、次にLLM分類器が実際の失敗が発生したかどうかを確認してそのカテゴリーと重大度をラベル付けし、2回目のパスがその特定のターンを再チェックし、最後に採点用の正しい参照解が生成されます。
失敗の分類自体が示唆に富んでいます。ハルシネーションの側では、支配的な問題は珍しいものではありません。エージェントは他の何よりもはるかに多く、ポリシーを捏造または誤って述べます。

ツール呼び出しの失敗も同じくらい密接に集まっています。1,514ケースのうち、最大の2つのカテゴリーは、必要な呼び出しの欠落(897)と不要な呼び出しの発火(520)です。誤ったツールの選択はほぼ皆無です(2ケース)。言い換えれば、モデルが誤ったツールを選ぶことはまれです。失敗するのは判断、すなわちいつ行動し、いつ控えるかを知ることです。
採点にはLLMカウンシルを用います。これは、記述的なルーブリックと生成された参照解に対して各ケースを採点する、主要なフロンティアモデルのパネルです。1つではなく複数の強力なジャッジを使うことで、評価が単一のモデルの盲点を引き継ぐのを防ぎ、意見の不一致はパネル内で調整されます。
絶対的なスコアはルーブリックとジャッジによって変動するため、私たちは正確な数値ではなくランキングをシグナルとして扱います。
最高スコアは約88%であり、それは意図的なものです。本番の全分布で採点すれば、ほぼすべてのフロンティアモデルが90%を超え、リーダーボードは何の情報も与えなくなります。簡単な通話は誰にとっても簡単です。
そのため、vCX-Hardは最も難しいターン、モデルが実際に分かれる瞬間から構築されています。これはあらゆる本格的なベンチマークの仕組みです。数学のベンチマークは、典型的なユーザーが入力する算術ではなく、競技問題を使います。目標は見栄えの良い数値ではありません。目標は、モデル間で、そして新しいモデルが登場するにつれて時間を超えて比較できる数値です。
すべてのリーダーボードを2通りで示します。本番(推論オフ、ライブ通話で動作するもの)と、ベスト(各モデルの最も強力な推論設定、上限を示すもの)です。非ハルシネーションでは、GPT-5.5が両方でリードします。本番ではGPT-5系列とgemini-3.1-proが上位に位置し、推論をオンにすると同じ顔ぶれが数ポイント上昇し、その後ろの追走順が入れ替わります。

ツール呼び出しの正確性は、2つのビューが最も大きく分かれる場所です。推論をオンにすると、GPT-5.5がリードします。しかし実際に動作する本番では、GPT-5.5のツール呼び出しは88.3%から75.6%へと低下し、gemini-3.1-proが最良のツール呼び出し役となり、推論オフで85.7%を維持して明確な差をつけます。エージェントを推論オフで動作させるなら、最も強力なモデルは同じではありません。

全体を通じて3つのパターンが際立ちます。
1. 推論が2つのビューの差である。推論をオンにすると、ほぼすべてのモデルでスコアが上昇し、非ハルシネーションでは平均して約5ポイント上がります。GPT-5.5は、話す前に推論すると84.8%から88.0%へと上昇します。その代償はレイテンシであり、これがほとんどの本番エージェントが推論をオフにする理由であり、本番ビューが計画を立てる際に基準とすべきものである理由です。

2. 事実への根拠付けと行動は異なるスキルである。2つの軸は同じようにはランク付けされません。根拠付けに強いモデルがツール呼び出しでは平凡なこともあり、その逆もあります。GPT-5.4は根拠付けで上位近くにランクされますが、ツール呼び出しでは上位10位の外で、claude-4.5-sonnetはその逆です。モデルを選ぶことは、実のところ、お客様が最も許容できない失敗はどれかという問題です。
3. まだ安全なモデルはない。最良のモデルでさえ、リーダーは各軸で最も難しいターンの約8回に1回を依然として取りこぼし、本番ではさらに多く取りこぼします。ベンチマークスコアと信頼できる導入との差こそが、プラットフォームがモデルの上で行う作業そのものです。
モデル世代を通じて見ると、フロンティアは正しい方向に動いています。GPT-4oからGPT-5.5にかけて、非ハルシネーションは72.8%から88.0%へと上昇し、ツール呼び出しも同様の軌跡で改善しています。

各モデルの本番(推論オフ、ライブで動作するもの)とベスト(最も強力な推論設定)を、本番の非ハルシネーションでソートしています。高いほど良いです。
| モデル | 非ハルシネーション % | ツール呼び出し % | ||
|---|---|---|---|---|
| 本番(推論オフ) | ベスト(推論あり) | 本番(推論オフ) | ベスト(推論あり) | |
| gpt-5.5 | 84.8% | 88.0% | 75.6% | 88.3% |
| gpt-5.4 | 83.0% | 83.3% | 75.2% | 77.4% |
| gemini-3.1-pro | 82.6% | 83.6% | 85.7% | 85.9% |
| gpt-5.2 | 81.3% | 81.6% | 79.6% | 81.5% |
| claude-4.6-sonnet | 81.2% | 81.6% | 80.1% | 80.4% |
| glm-5.1 | 79.3% | 82.7% | 77.3% | 83.8% |
| gpt-5.1 | 75.7% | 81.0% | 78.2% | 83.7% |
| gemini-3.1-flash-lite | 74.4% | 77.7% | 69.0% | 75.8% |
| gemini-3-flash | 73.8% | 80.1% | 71.2% | 81.8% |
| gpt-4o | 72.8% | 72.8% | 63.6% | 63.6% |
| claude-4.5-haiku | 72.4% | 78.7% | 70.7% | 79.4% |
| gemini-2.5-pro | 72.3% | 77.2% | 72.9% | 80.6% |
| gemini-3.5-flash | 72.0% | 80.7% | 69.2% | 84.0% |
| claude-4.5-sonnet | 71.5% | 80.6% | 77.5% | 85.8% |
| gpt-4.1 | 71.5% | 71.5% | 62.2% | 62.2% |
| gpt-5 | 71.2% | 78.8% | 68.9% | 83.2% |
| gpt-5.4-mini | 70.7% | 71.3% | 57.1% | 60.2% |
| gpt-5-mini | 69.4% | 75.2% | 70.6% | 75.6% |
| o4-mini | 67.9% | 67.9% | 73.9% | 73.9% |
| gpt-5.4-nano | 66.2% | 66.3% | 57.5% | 59.1% |
| grok-4.3 | 65.8% | 76.3% | 54.6% | 72.1% |
| kimi-k2.6 | 63.5% | 63.5% | 66.3% | 66.3% |
| o3-mini | 62.7% | 62.7% | 59.0% | 59.0% |
| gemini-2.5-flash-lite | 59.8% | 75.2% | 47.0% | 70.3% |
| mercury-2 | 56.7% | 61.9% | 52.2% | 55.9% |
| gpt-5-nano | 53.9% | 57.6% | 54.5% | 56.1% |
| deepseek-v4-pro | 49.8% | 55.6% | 58.9% | 64.5% |
本番は各モデルの推論オフ、または利用可能な最も低い設定です。ベストはその最も強力な推論設定です。列が一致しているモデル(gpt-4o、gpt-4.1、kimi-k2.6、o4-mini、o3-mini)は単一の設定で評価されました。
ベンチマークは、構築の仕方を変えてこそ有用です。vCX-Hardが明らかにするギャップは、Retellプラットフォームの機能に直接対応しているため、それらを自分で作る必要はありません。
モデル選択は第一歩です。モデルを取り巻くプラットフォームこそが、ベンチマークスコアを信頼できる導入へと変えるものです。
vCX-Hardは初期バージョンであり、実際の限界があります。採点はLLMジャッジパネルに依拠しており、それ自身のバイアスを伴います。ケースは難易度のために抽出されているため、スコアは平均的な通話品質ではなく最も難しいターンを反映します。そしてベンチマークは2つの特定の失敗モードを測定するものであり、トーン、レイテンシ、割り込み処理といった通話の全体的な体験ではありません。
私たちは新しいモデルが登場するたびにvCX-Hardを更新し続けます。すべてのローンチは、音声エージェントを運用するすべてのチームに同じ問いを引き起こします。新しいモデルが出た、切り替えるべきか?vCX-Hardは、推測ではなく現在のデータでそれに答えるために構築されています。
ベンチマークは数値を良く見せるためのものではありません。誠実な比較のためのものです。1つが飽和すると、この分野はより難しいものを構築します。vCX-Hardは私たちが社内でモデルを選ぶ方法であり、お客様が実際に尋ねる問いに、ブランド名ではなく証拠で答える方法です。私たちはモデルが向上するにつれて基準を引き上げ続けます。
AI搭載の音声エージェントに切り替えることで、あなたのビジネスがどれだけ節約できるかをご確認ください。
Total Human Agent Cost
AI Agent Cost
Estimated Savings
Retell クリニックオフィスのデモ電話番号

Start building smarter conversations today.




.avif)