音声AIベンチマーク:Medicareワークフロー精度でRetellが1位


新たな音声AIベンチマークでは、1つのMedicare保険エージェントを一行も変更せずに6つの異なるプラットフォームへ配置し、どのプラットフォームが実際にワークフローを守れるかを測定しました。結果、Retellが1位となりました。
このテストを実施したのは、音声エージェント向けの評価基盤を構築する独立系企業Cekuraです。Medicareを題材とした実験では合計414件の通話を行い、規制対象である保険の会話をどれだけ確実に処理できるかを各プラットフォームで採点しました。
Retellはワークフロー精度95.7%でトップに立ち、23項目のチェックのうち22項目をクリアしました。すべてのプラットフォームが同一のエージェントを実行していたにもかかわらず、他のプラットフォームは65.2%から95.7%の間に分布しました。
要点まとめ
Cekuraはバイト単位で同一のMedicareエージェントを6つの音声プラットフォームに展開し、414件の通話を実施しました。
Retellはワークフロー精度95.7%で1位となり、23の評価項目のうち22項目に合格しました。
全体のスコアは65.2%から95.7%まで分布しており、差を生んだのはエージェントではなくプラットフォームでした。
Retellは実行時の失敗も加味する厳格なエンドツーエンド評価でも、同じく95.7%で首位を維持しました。
規制対象のMedicare通話では、この差がコンプライアンスに沿った取次と、通話切断や違反対応との違いになります。
CekuraはMedicare TPMOエージェントを1つ構築し、バイト単位で同一のコピーを6つの各プラットフォームに展開しました。プロンプトも、ツールも、音声も同じです。唯一の変数は、その下で動作するプラットフォームだけでした。
TPMOとはサードパーティ・マーケティング組織のことで、Medicare AdvantageやPart Dのプランを販売する免許を持つ代理店を指します。こうした通話は厳しく規制されているため、エージェントは多くの要件を、決まった順序で正しく満たす必要があります。
このベンチマークでは23の評価項目を使用し、それぞれが保険通話で崩れやすいポイントを狙っています。項目は4つのグループに分かれます。通話の開始と同意の取得、発信者が本当に必要としているものの把握、リード選別(リードクオリフィケーション)と情報取得、そして消費者保護の範囲内にとどまること、です。
各評価項目はプラットフォームごとに3回実行され、3回すべてに合格した場合のみ得点が認められます。Cekuraはこれをpass^3と呼んでいます。23の評価項目×3回×6プラットフォームで、合計414件の通話となります。方法論とプラットフォームごとの実行結果はCekuraのベンチマークページで確認できます。
6つのプラットフォームのスコアを、ワークフロー精度順に示します。
| プラットフォーム | ワークフロー pass^3 | 厳格なエンドツーエンド pass^3 |
|---|---|---|
| Retell | 95.7%(22/23) | 95.7%(22/23) |
| ElevenLabs | 91.3%(21/23) | 91.3%(21/23) |
| Pipecat | 82.6%(19/23) | 73.9%(17/23) |
| LiveKit | 73.9%(17/23) | 73.9%(17/23) |
| Synthflow | 69.6%(16/23) | 8.7%(2/23) |
| Vapi | 65.2%(15/23) | 65.2%(15/23) |
ワークフロー精度で95%を超えたのはRetellだけで、後述のより厳格な指標でもそのスコアを維持しました。
Cekuraが2つのスコアを報告したのは、音声エージェントの失敗には2つの異なる形があるためです。
ワークフローpass^3は、エージェントが正しいアクションを選び、ツールを正しく呼び出したかどうかを問います。Cekuraが言うExpected OutcomeとMock Tool Accuracyという2つのシグナルを用います。
厳格なエンドツーエンドpass^3は、さらにもう1つの問いを加えます。発信者は実際にタスクを完了できたのか、という点です。意図したアクションが正しかったとしても、通話中にエージェントが停止するなどのインフラ障害によって発信者が完了できなかったケースを算入します。
Retellは両方で95.7%を記録し、実行時の問題でスコアを落としませんでした。一方、落としたプラットフォームもあります。Synthflowはワークフロー精度では23項目のうち16項目に合格しましたが、厳格な採点では23項目のうち2項目のみでした。ツール利用中に、エージェントがまだ処理中である気配もないまま、発信者が長い沈黙に置かれることが多かったためです。
Medicareの販売通話では、エージェントは単に質問に答えるだけではありません。必要な開示事項を伝え、プランを説明する前に同意を得て、個別のアドバイスを避け、適切なタイミングで免許を持つ担当者に発信者を取り次ぐ必要があります。
これらの手順は連邦のTPMO規則で定められており、1つ飛ばすことは些細な粗さではなくコンプライアンス上の問題になります。
23の評価項目が検証したのはまさにこの点です。発信者が開示の途中で割り込み、プランの詳細を求める。家族が受給者の代わりに電話をかけてくる。発信者がエージェントに、そのプランで自分の薬が対象になると約束してほしいと求める。いずれのケースでも正しい対応は明確に決まっており、停止したり即興で対応したりするプラットフォームは、発信者への対応とコンプライアンス記録の両方を同時に損ないます。
このベンチマークが示すのは、同じエージェントを動かすだけでは十分ではないということです。最もリスクの高い通話でそのエージェントが持ちこたえられるかは、その下にあるプラットフォームが決めます。
Retellは、電話の発信・受信を行うAI音声エージェントを構築、テスト、デプロイ(導入・展開)、モニタリングするためのプラットフォームです。このベンチマークが評価したのは、Retellが中心に据える2つの要素、すなわち複数ステップのワークフローを守ることと、プレッシャーの中で正しくツールを呼び出すことでした。
免許を持つ担当者へのウォームトランスファー(事前取次):発信者が人と話す必要がある場合、エージェントはすでに収集した文脈とともに、通話転送を使って引き継ぎます。
台本外のアドバイスではなく、ナレッジベースからの回答:エージェントは接続されたナレッジベースから事実に基づく回答を取得し、許された範囲内にとどまります。
すべての通話を事後にレビュー:チームは通話後分析とAI品質保証を使って、フローが持ちこたえた箇所と崩れた箇所を確認します。
規制業界向けに設計:Retellは、通話における手順の順序が任意ではないヘルスケアや保険のチームに向けてAI音声エージェントを提供しています。
これは1つのワークフローに対する1件の独立したテストであり、結果はエージェントの構築方法や運用方法によって変わります。それでも、難易度が高く規制のあるタスクにおいて、Retellは他を上回る結果を示しました。
音声AIベンチマークとは、同じタスクを異なる音声エージェントプラットフォームで実行し、それぞれの処理能力を採点する管理されたテストです。Cekuraの手法では、比較の公平性を保つために反復通話と固定の評価項目を使用しています。
音声エージェント向けの評価ツールを開発する独立系企業Cekuraです。Retellがテストを実施したり自社を採点したりはしていません。
プラットフォームが1つの評価項目で得点を得るには、3回の別々の実行すべてに合格する必要があります。運よく1回成功しただけでは認められないため、このスコアは単発の good call ではなく一貫性を測る指標になります。
はい。Cekuraはバイト単位で同一のMedicareエージェントを、同じプロンプト、ツール、音声のまま6つすべてのプラットフォームに展開しました。したがってスコアの差はエージェントではなくプラットフォームに起因します。
Cekuraは自社のベンチマークページで、プラットフォームごとの実行結果と完全な方法論を公開しており、Medicare実験における各評価項目の内訳も含まれています。
難しい通話でも持ちこたえる音声エージェントを構築しましょう。
Retellでは、AI音声エージェントを構築、テスト、リリースし、すべての通話でのパフォーマンスを確認できます。Retellを無料で試す、または営業に問い合わせる。
AI搭載の音声エージェントに切り替えることで、あなたのビジネスがどれだけ節約できるかをご確認ください。
Total Human Agent Cost
AI Agent Cost
Estimated Savings
Retell クリニックオフィスのデモ電話番号

Start building smarter conversations today.

