音声AIが実際の通話で最も難しい部分をどう処理するか:IVRツリー、留守番電話検出、発話途中の割り込み、下限価格エスカレーション

音声AIが実際の通話で最も難しい部分をどう処理するか:IVRツリー、留守番電話検出、発話途中の割り込み、下限価格エスカレーション
ブログ一覧へ戻る
このページの目次
トップへ戻る

ほとんどの音声AIデモが素晴らしく見えるのは、実際の通話が破綻する4つの場面を避けているからです。エージェントは、他者のIVRでボタンを押し進め、応答したのが人間か留守番電話かを2秒で判断し、話者にかぶせられても筋を失わずに復帰し、ルールを把握した顧客に対して価格ラインを守らなければなりません。これらはそれぞれ独自の失敗モードを持つ別々のエンジニアリング課題であり、一つをうまく処理できるプラットフォームでも他でひどく失敗することがあります。

本稿では、これら4つの場面のそれぞれの裏側で実際に何が起きているのか——アーキテクチャがどのようなものか、トレードオフがどこにあるか、そして2026年に本番環境のチームが見ている数値——を解説します。デモ用エージェントと本番用エージェントの差は、ほぼ完全にこの4つの挙動に含まれているため、詳細が重要になります。

簡単な通話と難しい通話の違い

簡単な通話は単一ターンで境界が明確です。発信者がエージェントの学習済みの質問をし、エージェントが答えを取得し、通話が終わります。難しい通話は、これらの前提の少なくとも一つを崩します。会話が、実際の結果を伴うアクション(返金の予約、送金、価格への合意)をエージェントに求める、相手がデモが想定した協力的な発信者ではない(IVR、留守番電話ボックス、悪用を試みる怒った顧客)、あるいは会話が予期しない何か(バージイン、意図の聞き間違い、第三者の通話参加)から復帰する必要がある、といった場合です。

本番グレードの音声AIを磨き上げられたプロトタイプと分けるのは、システムが最初から2つ目のカテゴリー向けに設計されたかどうかです。以下のすべての挙動——DTMF送出、非同期の留守番電話検出、意味論的な割り込み処理、サーバー側のガードレール——は、それなしでエージェントをリリースした誰かが、プロンプトでは修正できない形で測定可能な割合の通話が失敗するのを目にしたために存在します。

他者の電話ツリーでボタンを押す

音声エージェントが保険会社、病院の請求部門、サプライヤーのサポート回線に発信すると、通常は人間に到達する前に音声自動応答メニューに当たります。エージェントはメニューを聞き、通話の目的に合う選択肢を判断し、正しいトーン番号を送信し、人間に到達するまで繰り返さなければなりません——その間、一言も声を出さずにです。ほとんどのIVRは音声入力を無視するからです。

新しい開発者を戸惑わせる技術的な難点は、音声コーデックが人間の発話を圧縮するように設計されており、番号押下のデュアルトーン周波数を破棄すべきノイズとして日常的に扱うことです。だからこそ、トーン音のオーディオを通話メディア上で再生して「2を押す」エージェントは、断続的に動作し、テストでは成功し、その後本番のキャリアでランダムに見える形で失敗します。修正策は、番号をオーディオストリームに混ぜるのではなく、 RFC 4733テレフォニーイベントとしてアウトオブバンドで送信することです——これはIVRのメディアゲートウェイが直接処理するSIPシグナリングメッセージです。

ドキュメントからは明らかでないタイミングの問題もあります。多くのIVRはメニューのプロンプトがまだ再生中に送られた番号を無視し、他のものは人間の親指で押せるより速く到着する番号のシーケンスを破棄するバッファを持っています。本番のナビゲーターはプロンプトが終わるのを聞き、一拍待ち、最初の番号を送信し、その後、会員IDや口座番号のシーケンスでは後続の番号の間で一時停止するか、次のメニューレベルで再び一時停止します。これを間違えると、一般的な企業IVRではおよそ3分の1の確率で誤った部門に到達します。

最後の引き継ぎは、ほとんどのチームが作り込みを怠る部分です。IVRがついに人間に接続すると、エージェントはナビゲーションのコンテキスト——照合していたメニュー選択肢、「請求部門を探している」というステートマシン——を破棄し、本来行うべき実際の会話に切り替える必要があります。うまくやれば、人間は「こんにちは、Sarah Mitchellさんに代わって請求#74821についてお電話しています」と聞き、最後のメニュープロンプトをまだ解釈しようとしている混乱したエージェントを聞くことはありません。Retell AI はこれを、番号が必要なときにエージェントが呼び出す press_digit関数を通じて公開しており、人間が電話に出た後に実行される会話ロジックとは分離されています。

応答したのが人間か機械かを知る

通話が接続されてから最初の3秒は、いかなるアウトバウンド会話においても最も重大です。回線に人間が出たのにエージェントが待ちすぎると、その人は「もしもし?」を2回言って切ります。留守番電話が応答したのにエージェントが完全な冒頭を始めると、メッセージの半分はビープ音で切られ、受信者は後で再生したときに混乱した機械的なものを聞くことになります。

これらを区別するレガシーなアプローチは、留守番電話検出(AMD)と呼ばれ、音響的なヒューリスティクスを使います。初期の無音の長さ、挨拶の長さ、オーディオのエネルギーエンベロープなどです。これらの手法は 70~85パーセントの精度範囲のどこかに落ち着き、それらに基づいて構築された本番のアウトバウンドキャンペーンが、実在の人間の回線にメッセージを残す形で相当な割合の発信を無駄にするほど高い偽陽性率を生みます。

現世代のAMDは、波形の代わりに文字起こしを読みます。留守番電話の挨拶は文字どおり自らを名乗ります——「おかけになった番号は」「メッセージをお残しください」「発信音の後に」——そしてその言語シグナルは、長い一時停止と素早い「もしもし」の間で似て見える音響的特徴よりもはるかに信頼できます。文字起こしされたオーディオに再帰型ニューラルネットワークを使った最近の発表研究では、テストセットで96パーセントを超える精度に達し、無音検出チェックと組み合わせると98パーセントを超える道筋がありました。

モデルの問題よりも重要なモードの問題があります。同期AMDは、通話を接続する前に判定を待つため、実在の人間がロボコールと解釈して切る3~5秒の無音を追加します。非同期AMDは通話を即座に接続し、エージェントが簡潔な何かを言う間、並行する分類器に最初の1~2秒を聞かせ、その後判定に基づいて挙動を切り替えます——判定が「人間」なら会話を続け、「機械」なら事前スクリプトの留守番電話メッセージに転換します。本番デプロイが使うのは非同期です。冒頭はどちらの相手にも機能するよう設計されています。「こんにちは、Mayaです」は人間には普通に聞こえ、エージェントが取り返しのつかない何かを言う前に分類器に確定する余地を与えます。

これを間違えるコストは量に比例して拡大します。月4,000万件の通話を処理するプラットフォーム——Retell AI の 2026年1月時点の現在の稼働率——では、1パーセントの偽陽性率が40万件の誤分類された通話になります。これが、本番チームをテレフォニープロバイダーに付属するAMDシグナルではなく、専用構築のインフラへと押しやる数字です。

破綻せずに割り込みを処理する

実際の会話はきれいに順番を取り合いません。人は割り込み、お互いにかぶせて話し、相手がまだ話している間に「うんうん」を入れ、発話途中で考えを変え、考えを言い終えずに言葉尻を濁します。自分のターン中のあらゆる音を割り込みとして扱う音声AI——基本的な音声区間検出のデフォルト挙動——は、ぎこちなくロボット的に聞こえます。自分のターン中のあらゆる音を無視する音声AIはまったく割り込めず、これはエージェントの応答が長く続くほど悪く感じられます。

難しい問題は、発信者が話したことを検出することではありません。数百ミリ秒以内に、彼らが言ったことがフロアを譲るべき本物の割り込みなのか、無視すべき相槌——「なるほど」「はい」「うんうん」「わかりました」——なのかを判断し、エージェントが話し続けられるようにすることです。どちらの方向でもこれを間違えると、発信者は言葉にできないが確実に感じ取る形で通話が不自然に感じられます。

本番のアプローチは、エージェントの再生中に3つのシグナルを並行して実行します。ストリーミングの音声区間検出器がいかなる有声オーディオも監視します。ストリーミングの文字起こしが、発信者の発話からおよそ100ミリ秒以内に部分的な文字起こしを出力します。意味論的分類器がその部分文字起こしを読み、実行可能な意図(「待って、戻ってもらえますか?」)を運んでいるのか、単なる確認のノイズなのかを判断します。実行可能な意図のみがバージインをトリガーし、これはテキスト読み上げストリームを切り、言いかけた応答を破棄し、言語モデルが切られた応答を生み出したプロンプトではなく新しい入力に応答するよう会話状態を巻き戻します。

ここではすべてが積み重なるため、エンドツーエンドのレイテンシ(遅延)が重要です。自然な人間のターンテイキングは200~300ミリ秒の範囲にあります。700ミリ秒未満なら会話的に読み取られ、900ミリ秒を超えると発信者は気づいて離脱します。Retell AI が公表する 約600msの応答レイテンシ——発信者の最後の言葉からエージェントの最初の言葉まで測定——は、ループからさらに150ミリ秒を削った最近のターンテイキングモデルのアップデートによるもので、これが復帰を謝罪的ではなく自然に感じさせます。エージェントは「すみません、聞き取れませんでした」とは言いません。発信者が方向転換したところから拾い、続けます。

見落としやすいもう一つの要素があります。発信者が割り込んだとき、エージェントは何が言われ、何が言い残されたかを追跡しなければなりません。エージェントが価格を提示している途中で発信者が保証について尋ねに割り込んだ場合、エージェントは価格の提示が未完だったことを覚えており、それに戻ることを申し出る必要があります。この会話状態の連続性が、復帰するエージェントと筋を失うエージェントの違いです。

それがAIだと知っている顧客に対して価格ラインを守る

交渉は、プロンプトベースのガードレールが最も目立って失敗する場面です。「899ドル未満に値引きしないこと」と言うシステムプロンプトは、それを試さない95パーセントの顧客には機能します。残りの5パーセント——マネージャーへの通話を演じる顧客、以前の担当者がすでに別の数字を承認したと主張する顧客、単に同じ質問を15通りに尋ねる顧客——はまさに最も強く押してくる者たちであり、言語モデルは最終的に譲歩します。

アーキテクチャ上の修正策は、価格をプロンプトから完全に取り除き、関数呼び出しの背後に置くことです。エージェントは会話の中で価格について自由に話せますが、数字にコミットしようとした瞬間、そのコミットメントはpropose_price関数を通り、提案された値をSKUと顧客セグメントに紐づいたサーバー側の下限と照合します。関数は、数字が発話される前に下限を下回るものを拒否します。下限は言語モデルが見られないコードの中にあり、つまり回避的に推論されたり、プロンプトインジェクションされたり、より低い値に説得されたりできません。

同じパターンが関連する問題を処理します。サポートでの返金権限の上限、リテンションでの値引き承認の上限、債権回収での支払いプランの最低額、そしてエージェントが顧客と保険会社と同時に電話している三者通話ワークフローです。いずれの場合もルールは同じです——コミットされたすべてのアクションはサーバー側の検証を伴う関数を通り、検証に失敗したものは許容範囲内でリトライするか、人間にエスカレートします。Gladiaの音声AI安全性研究はこのパターンを「ハードコードされたレッドライン——モデルの外側にあり、オーケストレーションレベルで強制されるルール」と呼んでおり、これはAIと話していると知っている敵対的なユーザーに耐えられる唯一のアプローチです。

名前を挙げるに値する二次的なメリットがあります。このアーキテクチャは、ハルシネーションによるコミットメントも防ぎます。関数でゲートされたアクションのない音声エージェントは、会社に記録のない返金を自信を持って約束したり、どのシステムも実際にはサポートしていない配送日を提示したり、決してスケジュールされないコールバックに同意したりできてしまいます。関数レイヤーが所定の位置にあれば、エージェントが行うすべてのコミットメントは、システムが実際に同意したものになります。発表研究における音声AIのハルシネーション率は、この種のガードレールが所定の位置に置かれると、27パーセントのベースラインから5パーセント未満に下がります。これが、役に立つエージェントと、節約する以上の後始末作業を生むエージェントの違いです。

エスカレーションが正しい答えなのはいつか?

難しい通話向けに構築された音声AIは、解決しない通話のための定義された予算を持っています。Medical Data Systemsのデプロイは、インバウンドの債権回収で人間への転送率30パーセントで稼働しています——つまり10件中7件の通話は人なしで解決し、残りの3件は完全な文字起こしと関数呼び出しの履歴を添付してきれいにエスカレートするよう設計されています。同社のCIOはこれを 公に説明しています。プラットフォームは「今やインバウンド通話の100%を、わずか30%の転送率で処理し、労せずスケールし、患者の信頼を犠牲にすることなく月に約28万ドルを回収している」と。

それらのエスカレーションを発火させるトリガーは、上で扱った同じ4つの挙動が、失敗モードになっただけです。下限価格の関数が3回連続でオファーを拒否した、AMD分類器がコールバックで「不確実」を2回返した、IVRナビゲーションが5つのメニューレベルの後に人間に到達できなかった、割り込み復帰レイヤーが30秒でターンの衝突を3回検出した。それぞれは雰囲気での判断ではなく定義されたシグナルであり、それぞれが通話を、ゼロから始めるのではなくエージェントが止まったところから拾う人間へとルーティングします。ウォームトランスファー(事前取次)が、AIの部分を無駄な通話ではなく先行スタートのように感じさせるものです。

Sunshine Loansのデプロイは逆のデータポイントです。エージェントが通話を解決できるなら、そうすべきです。同社のチームは 月70万件を超える申請を処理し、離脱率は20~30パーセントから5~6パーセントに下がりました。発信者がピーク時に留守番電話や保留キューに当たらなくなったためです。人なしで完全に解決する75~80パーセントの通話は、同じ事業の以前のバージョンなら留守番電話に送るか、対応のために人員を増やしていたであろう通話です。

本番チームがローンチ後に注視するもの

難しい通話のパフォーマンスにとって重要な指標は、汎用ダッシュボードには現れません。封じ込め率(エージェントが完全に解決した通話)と転送率(人間に引き継ぐ通話)は必要ですが十分ではありません——それらはエージェントが通話を終えたかどうかを教えますが、正しく終えたかどうかは教えません。上記の4つの失敗モードを捉える診断指標は異なります。

IVRナビゲーションでは、正しい指標は接続率ではなく、IVRターゲット別のタスク完了率です——エージェントがダイヤルする各固有の電話ツリーで意図した部門にどれだけの頻度で到達したかを、キャリア別に切り分けます。特定の番号でこの指標が低下するのは、通常プロンプトの問題ではなくDTMFの信頼性の問題です。留守番電話検出では、正しい指標は偽陽性率(機械と誤分類された人間)を偽陰性率とは別に追跡することです。各方向のコストが異なり、正しいチューニングはキャンペーンによるためです。割り込み処理では、正しい指標は誤バージ率——無視すべきだった相槌でエージェントの応答が途中で切られたもの——であり、これは総割り込み数よりも表面化させるのが難しいですが、発信者のフラストレーションをはるかによく予測します。価格ラインと承認上限の挙動では、正しい指標は、エージェントの約束を額面どおりに読むのではなく、実際のサーバー側ルールに対して文字起こしをサンプリングして測定するポリシー遵守率です。

Retell AI の 通話後分析レイヤーは、人間のQAがレビューできる2パーセントのサンプルではなく、すべての文字起こしをこうした次元でスコアリングします。これが、真剣なデプロイが運用する量で指標を実行可能にするものです。2025年のRetell Assureのリリースはさらに進み、QAループそのものを自動化しました——プラットフォームが音声AIの通話を監視し、人間がインタラクションを抜き取り検査することなく改善候補を表面化させます。月4,000万件の通話では、これが計算が成り立つ唯一の方法です。

よくある質問

音声AIはあらゆるIVRシステムを確実にナビゲートできますか?

番号がオーディオに混ぜられるのではなくアウトオブバンドのSIPテレフォニーイベントとして送信される場合、ほとんどの標準準拠のトーン式IVRを確実にナビゲートできます。例外は、入力を受け付ける前にビープ音を必要とするIVR、メニューと番号の間のタイムアウトが非常に短いIVR、そしてDTMFと必須の音声入力を混在させるIVRです。本番チームはローンチ前にダイヤルする必要のある特定の電話ツリーに対してテストし、持続的なエッジケースにはIVRごとのリトライロジックを追加します。

アウトバウンドの音声AI通話で留守番電話検出はどれくらい正確ですか?

現代の文字起こしベースの留守番電話検出は、3秒未満のレイテンシで95~98パーセントの精度範囲に落ち着きます。これは、ほとんどのテレフォニープロバイダーに付属するレガシーなエネルギーと無音のヒューリスティクスの70~85パーセントと比較してです。精度の上限は、偽陽性(実在の人間を機械として扱い、会話を失う)に合わせてチューニングするか、偽陰性(機械を人間として扱い、混乱したメッセージを残す)に合わせるかによります。正しいトレードオフはキャンペーンの種類によって異なります。

音声AIが割り込みを自然に処理するには何が必要ですか?

並行して実行される3つのものです。エージェントの再生中に音を監視する音声区間検出器、約100ミリ秒以内に部分的な文字起こしを出力するストリーミング文字起こし、そして「うんうん」のような相槌から本物の割り込みを区別する意味論的分類器です。3つ目のレイヤーがなければ、エージェントは本物の割り込みを無視するか、あらゆる息づかいや確認に譲るかのどちらかになり、どちらも通話で不自然に感じられます。

顧客が下限価格を下回る交渉をしないようにするにはどうしますか?

下限をシステムプロンプトから、言語モデルが見られないサーバー側の関数へと移します。エージェントは価格について自由に議論できますが、コミットされたすべての見積もりは、数字が発話される前に下限に対して検証する関数を通ります。これは敵対的なユーザーに耐えられる唯一のパターンです——プロンプトベースのガードレールは持続的な圧力の下で漏れますが、関数でゲートされたガードレールは漏れません。

音声AIが本物の会話のように感じられるには、どのレイテンシが必要ですか?

発信者の最後の言葉からエージェントの最初の言葉まで測定して、エンドツーエンドで700ミリ秒未満です。900ミリ秒を超えると、発信者はギャップに気づき、離脱し始めます。Retell AI は月4,000万件の通話にわたる測定された本番の数値として約600msのレイテンシを公表しており、これは会話的なしきい値を余裕を持って下回り、その上に関数呼び出しのレイテンシのためのヘッドルームを残します。

音声AIが通話を解決できないとどうなりますか?

定義されたエスカレーショントリガーが発火し、通話は完全な文字起こし、関数呼び出しの履歴、検出されたセンチメントが添付された状態で人間にルーティングされます。本番デプロイはこれらのトリガーを明示的に定義します——ガードレールが2回拒否した、AMDの判定が2回不確実だった、IVRナビゲーションが深さのしきい値を超えて失敗した、顧客が人間を要求した、センチメントが下限を下回った。人間は何が議論されたかをすでに知った状態で通話を引き継ぎます。これが、ウォームな引き継ぎとやり直しの違いです。

このアーキテクチャは、より小規模な通話量に見合いますか?

関数でゲートされたガードレールと非同期AMDは、敵対的な発信者や留守番電話の割合が無視できない量——通常、1日数百件を超えるもの——で不可欠になります。それ以下では、失敗モードは実在しますが、絶対数が十分に小さいため人間のQAが事後に捉えられます。割り込み処理レイヤーは、量に関係なく最初の通話から重要です。個々のすべての発信者がそれを体験するからです。

実践に移す

上記の4つの挙動が、会話の裏側での本番音声AIの姿です。それらをゼロから構築するのは、おおよそ6~12か月のエンジニアリングです——WebRTCメディア処理、コーデックネゴシエーション、DTMFのためのSIPシグナリング、ストリーミング文字起こしパイプライン、意味論的な割り込み分類器、関数呼び出しのオーケストレーションレイヤー、そして全体を改善可能にする通話後QAツール。試みるほとんどのチームは、簡単な部分をリリースし、難しい部分を本番で発見することになります。

より短い道筋は、これらの挙動がすでに所定の位置にあるインフラを使うことです。今や月4,000万件超の通話で運用しているプラットフォーム——Retell AI が公開の参照点です——が存在するのは、これら4つの挙動を大規模に間違えるコストが、ほとんどのコールセンターAIプロジェクトが過小評価しているものだからです。このアーキテクチャが実際の電話でどう聞こえるかを聞きたいなら、retellai.comで10ドルの無料クレジットでテストエージェントを立ち上げ、自分の番号を通じて通話をルーティングし、バージイン、IVR、下限価格の挙動を、それらについて読むのではなく本物で試すことができます。

ROI計算ツール
通話の自動化によるROIを試算

AI搭載の音声エージェントに切り替えることで、あなたのビジネスがどれだけ節約できるかをご確認ください。

完了しました! 
送信内容がメールに届いています
エラーが発生しました。フォームの送信中に問題が起きました。
   1
   8
20
エラーが発生しました。フォームの送信中に問題が起きました。

ROI結果

2,000

Total Human Agent Cost

$5,000
/month

AI Agent Cost

$3,000
/month

Estimated Savings

$2,000
/month
ライブデモ
ライブデモを試す

Retell クリニックオフィスのデモ電話番号

ありがとうございます!送信が完了しました!
エラーが発生しました。フォームの送信中に問題が起きました。

Read Other Blogs

Revolutionize your call operation with Retell