vCX-Hard:実際のコンタクトセンター通話で主要AIモデルをベンチマーク

vCX-Hard:実際のコンタクトセンター通話で主要AIモデルをベンチマーク
ブログ一覧へ戻る
このページの目次
トップへ戻る

vCX-Hardをご紹介します。これは、実際のコンタクトセンター通話で主要モデルをランク付けするRetellのベンチマークであり、音声エージェントが成功するかどうかを左右する2つの能力、すなわち事実に基づき続けること、そして正しいアクションを取ることを測定します。独自の本番通話データから構築されたvCX-Hardは、最も重要な場面でモデルのパフォーマンスを評価します。今日の最良のモデルでも最も難しいターンで約88%しかクリアできず、これこそがモデル選択が重要である理由です。

なぜこれを構築したのか

お客様が他のどんな質問よりも多く尋ねるのは、音声エージェントにどのモデルを使うべきか、という1点です。長い間、正直な社内の答えは名前を1つ挙げて肩をすくめることでした。数百万件の実際の顧客通話を扱うプラットフォームにとって、それでは不十分です。

コールセンターのエージェントの生死を分ける能力は2つだけです。

  • 事実に基づき続ける。企業の実際のポリシーと知識に基づいて答える。料金、ルール、約束を決して作り上げない。
  • 正しく行動する。正しい引数で、適切なタイミングで、正しいツールを呼び出す。必要なステップを飛ばさず、誰も求めていないアクションを取らない。

公開ベンチマークがこの両方を同時にテストすることはまれで、ライブ電話通話の条件で行われることはほとんどありません。それができるデータは入手が困難です。1社だけの通話ログでは、自信を持ってモデルをランク付けするには多様性が足りません。Retellは、多くの業界と導入にまたがる実際で多様な本番トラフィックを、あるモデルを別のモデルから区別するのに必要な量で保有しています。それこそが信頼できるコールセンターベンチマークに必要な唯一の材料であり、ほとんどのチームが集められないものです。

vCX-Hardのご紹介

名前がその内容を物語っています。小文字のvはvoice(音声)を表します。CXはcustomer experience(カスタマーエクスペリエンス)、すなわちコールセンターエージェントの日々の仕事です。Hardは手法です。私たちは実際の本番トラフィックの最も難しいターン、モデルが実際に差を見せる瞬間だけで採点します。本番通話の全分布では、ほとんどのフロンティアモデルがすでに90%をクリアしており、これは何の有用な情報も与えません。難しいスライスこそが、ベンチマークがその価値を発揮する場所です。

各ケースは手書きや合成生成ではなく、実際の本番通話から抽出されています。私たちは通話を決定づける2つの軸でモデルを採点します。

  • 非ハルシネーション率。エージェントがどれだけ確実に事実に基づき続け、作り話を拒むか。
  • ツール呼び出し正確性率。エージェントがどれだけ確実に正しいアクションを選択し実行するか。

私たちは27モデルにまたがる50の構成を評価しました。本番環境の音声エージェントはレイテンシのために推論をオフにして動作するため、全体を通じて2つのビューを報告します。本番(推論オフ、ライブ通話で動作するもの)とベスト(中程度の推論、推論がどれだけ役立つかの上限)です。GPT-5.5が両方でリードし、本番で84.8%の非ハルシネーション、ベストで88.0%に達します。どのモデルも解決には程遠く、まさにそこが要点です。

データセットをどのように構築したか

私たちは2026年2月6日から5月1日までの本番通話トラフィックを、約15日ごとに30分のウィンドウでサンプリングし、過去3か月に1,000件を超える通話のあった組織から抽出しました。重要なのは、組織レベルでサンプリングしたことで、少数の高ボリュームの組織がセットを支配しないようにしました。これにより、特定の顧客に偏ることなく、実際の導入にわたって分布が幅広く保たれます。

そのトラフィックから、私たちは2つの難しいケースのセットを厳選しました。2,075ケースのハルシネーションセットと、1,514ケースのツール呼び出しセットです。各ケースは多段階のパイプラインを通じて抽出されます。軽量な事前分類器が候補ターン(数値の主張、転送前の瞬間、ツールエラー、繰り返しまたは欠落した呼び出し)にフラグを立て、次にLLM分類器が実際の失敗が発生したかどうかを確認してそのカテゴリーと重大度をラベル付けし、2回目のパスがその特定のターンを再チェックし、最後に採点用の正しい参照解が生成されます。

失敗の分類自体が示唆に富んでいます。ハルシネーションの側では、支配的な問題は珍しいものではありません。エージェントは他の何よりもはるかに多く、ポリシーを捏造または誤って述べます。

__wf_reserved_inherit
図1. 2,075の厳選ケースにわたるハルシネーションのカテゴリー。出典:Retell-Eval。

ツール呼び出しの失敗も同じくらい密接に集まっています。1,514ケースのうち、最大の2つのカテゴリーは、必要な呼び出しの欠落(897)と不要な呼び出しの発火(520)です。誤ったツールの選択はほぼ皆無です(2ケース)。言い換えれば、モデルが誤ったツールを選ぶことはまれです。失敗するのは判断、すなわちいつ行動し、いつ控えるかを知ることです。

どのように採点するか

採点にはLLMカウンシルを用います。これは、記述的なルーブリックと生成された参照解に対して各ケースを採点する、主要なフロンティアモデルのパネルです。1つではなく複数の強力なジャッジを使うことで、評価が単一のモデルの盲点を引き継ぐのを防ぎ、意見の不一致はパネル内で調整されます。

絶対的なスコアはルーブリックとジャッジによって変動するため、私たちは正確な数値ではなくランキングをシグナルとして扱います。

なぜ最も難しいターンで採点するのか

最高スコアは約88%であり、それは意図的なものです。本番の全分布で採点すれば、ほぼすべてのフロンティアモデルが90%を超え、リーダーボードは何の情報も与えなくなります。簡単な通話は誰にとっても簡単です。

そのため、vCX-Hardは最も難しいターン、モデルが実際に分かれる瞬間から構築されています。これはあらゆる本格的なベンチマークの仕組みです。数学のベンチマークは、典型的なユーザーが入力する算術ではなく、競技問題を使います。目標は見栄えの良い数値ではありません。目標は、モデル間で、そして新しいモデルが登場するにつれて時間を超えて比較できる数値です。

結果

すべてのリーダーボードを2通りで示します。本番(推論オフ、ライブ通話で動作するもの)と、ベスト(各モデルの最も強力な推論設定、上限を示すもの)です。非ハルシネーションでは、GPT-5.5が両方でリードします。本番ではGPT-5系列とgemini-3.1-proが上位に位置し、推論をオンにすると同じ顔ぶれが数ポイント上昇し、その後ろの追走順が入れ替わります。

__wf_reserved_inherit
図2. 非ハルシネーション率、上位12モデル。本番対ベスト。

ツール呼び出しの正確性は、2つのビューが最も大きく分かれる場所です。推論をオンにすると、GPT-5.5がリードします。しかし実際に動作する本番では、GPT-5.5のツール呼び出しは88.3%から75.6%へと低下し、gemini-3.1-proが最良のツール呼び出し役となり、推論オフで85.7%を維持して明確な差をつけます。エージェントを推論オフで動作させるなら、最も強力なモデルは同じではありません。

__wf_reserved_inherit
図3. ツール呼び出し正確性、上位12モデル。本番対ベスト。

全体を通じて3つのパターンが際立ちます。

1. 推論が2つのビューの差である。推論をオンにすると、ほぼすべてのモデルでスコアが上昇し、非ハルシネーションでは平均して約5ポイント上がります。GPT-5.5は、話す前に推論すると84.8%から88.0%へと上昇します。その代償はレイテンシであり、これがほとんどの本番エージェントが推論をオフにする理由であり、本番ビューが計画を立てる際に基準とすべきものである理由です。

__wf_reserved_inherit
図4. 推論オフ対中程度、非ハルシネーション率。

2. 事実への根拠付けと行動は異なるスキルである。2つの軸は同じようにはランク付けされません。根拠付けに強いモデルがツール呼び出しでは平凡なこともあり、その逆もあります。GPT-5.4は根拠付けで上位近くにランクされますが、ツール呼び出しでは上位10位の外で、claude-4.5-sonnetはその逆です。モデルを選ぶことは、実のところ、お客様が最も許容できない失敗はどれかという問題です。

3. まだ安全なモデルはない。最良のモデルでさえ、リーダーは各軸で最も難しいターンの約8回に1回を依然として取りこぼし、本番ではさらに多く取りこぼします。ベンチマークスコアと信頼できる導入との差こそが、プラットフォームがモデルの上で行う作業そのものです。

モデル世代を通じて見ると、フロンティアは正しい方向に動いています。GPT-4oからGPT-5.5にかけて、非ハルシネーションは72.8%から88.0%へと上昇し、ツール呼び出しも同様の軌跡で改善しています。

__wf_reserved_inherit
図5. vCX-HardにおけるOpenAIのモデル世代、最良の標準設定。

完全なリーダーボード

各モデルの本番(推論オフ、ライブで動作するもの)とベスト(最も強力な推論設定)を、本番の非ハルシネーションでソートしています。高いほど良いです。

モデル非ハルシネーション %ツール呼び出し %
本番(推論オフ)ベスト(推論あり)本番(推論オフ)ベスト(推論あり)
gpt-5.584.8%88.0%75.6%88.3%
gpt-5.483.0%83.3%75.2%77.4%
gemini-3.1-pro82.6%83.6%85.7%85.9%
gpt-5.281.3%81.6%79.6%81.5%
claude-4.6-sonnet81.2%81.6%80.1%80.4%
glm-5.179.3%82.7%77.3%83.8%
gpt-5.175.7%81.0%78.2%83.7%
gemini-3.1-flash-lite74.4%77.7%69.0%75.8%
gemini-3-flash73.8%80.1%71.2%81.8%
gpt-4o72.8%72.8%63.6%63.6%
claude-4.5-haiku72.4%78.7%70.7%79.4%
gemini-2.5-pro72.3%77.2%72.9%80.6%
gemini-3.5-flash72.0%80.7%69.2%84.0%
claude-4.5-sonnet71.5%80.6%77.5%85.8%
gpt-4.171.5%71.5%62.2%62.2%
gpt-571.2%78.8%68.9%83.2%
gpt-5.4-mini70.7%71.3%57.1%60.2%
gpt-5-mini69.4%75.2%70.6%75.6%
o4-mini67.9%67.9%73.9%73.9%
gpt-5.4-nano66.2%66.3%57.5%59.1%
grok-4.365.8%76.3%54.6%72.1%
kimi-k2.663.5%63.5%66.3%66.3%
o3-mini62.7%62.7%59.0%59.0%
gemini-2.5-flash-lite59.8%75.2%47.0%70.3%
mercury-256.7%61.9%52.2%55.9%
gpt-5-nano53.9%57.6%54.5%56.1%
deepseek-v4-pro49.8%55.6%58.9%64.5%

本番は各モデルの推論オフ、または利用可能な最も低い設定です。ベストはその最も強力な推論設定です。列が一致しているモデル(gpt-4o、gpt-4.1、kimi-k2.6、o4-mini、o3-mini)は単一の設定で評価されました。

発見から本番へ

ベンチマークは、構築の仕方を変えてこそ有用です。vCX-Hardが明らかにするギャップは、Retellプラットフォームの機能に直接対応しているため、それらを自分で作る必要はありません。

  • ノードごとのLLM:どこでも勝つモデルはない。根拠付けと行動は異なるスキルであり、難しいターンで最良のモデルは簡単なターンでは過剰です。ノードごとのLLMでは、会話の各ステップを適切なモデルにルーティングできます。最も難しく重大なターンには最も強力なモデルを、挨拶や確認にはより速く安価なモデルを。最高水準の精度には、それが重要な場所でだけ料金を払えばよいのです。
  • 待機中の発話:ツール呼び出しには時間がかかります。エージェントが通話中にAPIにアクセスしたり何かを調べたりしなければならないとき、その往復で回線に無音が生じることがあります。待機中の発話は、ツール呼び出しの実行中も発信者を自然な発話で引き付け続けるため、間が回線が途切れたように感じられることはありません。
  • ナレッジベースへの根拠付け:すべての中で最も一般的な失敗です。ポリシーの捏造とナレッジベースの誤った引用は、ベンチマークにおける最大の2つのハルシネーションカテゴリーです。エージェントを自社のナレッジベースに根拠付けることで、回答がモデルの最良の推測ではなく、実際のポリシーに結びついたまま保たれます。
  • シミュレーションテスト:このベンチマークが見ることのできないケースです。vCX-Hardは私たちの本番トラフィックで動作します。あなたの最も難しい通話はあなた自身のものです。シミュレーションテストでは、同じ種類の評価をあなたのシナリオで実行できるため、実際に受ける通話に対してモデルを選び、調整できます。
  • AI QA:ベンチマークはモデルを採点し、AI QAはあなたの通話を採点します。vCX-Hardは固定されたセットで動作しますが、あなたの本番は変化し続けます。AI QAは、ここで重要な軸、すなわちハルシネーション、ナレッジベースの再現性、ツール呼び出しの正確性、さらに良い通話とは何かをあなたが定義するカスタムメトリクスで、ライブ通話のサンプルを継続的に採点します。

モデル選択は第一歩です。モデルを取り巻くプラットフォームこそが、ベンチマークスコアを信頼できる導入へと変えるものです。

限界と次に来るもの

vCX-Hardは初期バージョンであり、実際の限界があります。採点はLLMジャッジパネルに依拠しており、それ自身のバイアスを伴います。ケースは難易度のために抽出されているため、スコアは平均的な通話品質ではなく最も難しいターンを反映します。そしてベンチマークは2つの特定の失敗モードを測定するものであり、トーン、レイテンシ、割り込み処理といった通話の全体的な体験ではありません。

私たちは新しいモデルが登場するたびにvCX-Hardを更新し続けます。すべてのローンチは、音声エージェントを運用するすべてのチームに同じ問いを引き起こします。新しいモデルが出た、切り替えるべきか?vCX-Hardは、推測ではなく現在のデータでそれに答えるために構築されています。

なぜこれを共有するのか

ベンチマークは数値を良く見せるためのものではありません。誠実な比較のためのものです。1つが飽和すると、この分野はより難しいものを構築します。vCX-Hardは私たちが社内でモデルを選ぶ方法であり、お客様が実際に尋ねる問いに、ブランド名ではなく証拠で答える方法です。私たちはモデルが向上するにつれて基準を引き上げ続けます。

ROI計算ツール
通話の自動化によるROIを試算

AI搭載の音声エージェントに切り替えることで、あなたのビジネスがどれだけ節約できるかをご確認ください。

完了しました! 
送信内容がメールに届いています
エラーが発生しました。フォームの送信中に問題が起きました。
   1
   8
20
エラーが発生しました。フォームの送信中に問題が起きました。

ROI結果

2,000

Total Human Agent Cost

$5,000
/month

AI Agent Cost

$3,000
/month

Estimated Savings

$2,000
/month
ライブデモ
ライブデモを試す

Retell クリニックオフィスのデモ電話番号

ありがとうございます!送信が完了しました!
エラーが発生しました。フォームの送信中に問題が起きました。

Read Other Blogs

Revolutionize your call operation with Retell