デモを聞いて、音声AIがついに実用段階に達したと感じる。しかし実際の通話が入ると数秒で崩れてしまう。壊れるのは言語ではなく、タイミングだからです。
ターンテイキングとは、あなたがこれまで交わしてきたあらゆる会話を動かしている、言葉にされない掛け合いの振り付けです。あなたの脳はミリ秒単位で、相手が話し終えたのか、まだ考えているのか、強調のために間を置いているのか、それとも何か別のことを言おうとしているのかを判断します。あなたは数百もの手がかりから合図を読み取ります。下降調で終わる文、最後の語でのわずかな減速、話し続ける前の半秒の息継ぎ、目を合わせる仕草。2秒の遅延がある悪いビデオ通話で、皆が同時に話し始めては謝り合う状況になるまで、自分がこれをやっていることに気づきもしません。
音声AIも同じ仕事をしなければなりませんが、生の音声から、リアルタイムで、視覚的な手がかりが一切ない状態で、しかも音声を元の忠実度のごく一部にまで圧縮する電話回線の上で、それをこなさなければなりません。エージェントは1回の通話で何十回も、いま話すべきか、もう少し待つべきか、それともユーザーが話し始めたので即座に話すのをやめるべきかを判断しなければなりません。その判断はモデルです。悪いモデルこそが、デモと本番システムを分ける違いになります。
デモは台本どおりです。通話の相手側にいる人は、エージェントが何を聞き取ることを期待しているかを知っており、エージェントが調整されたリズムに合わせてそれを提供する傾向があります。ベンダーの例のフローは、たまたま簡潔で明確に区切られた発話(「来週火曜の午後2時に予約を取りたいのですが」)を、静かなオフィスで、疲れても怒ってもいない、気を散らされてもいない人が話すものになっています。
しかし実際の発信者はそのようには振る舞いません。実際の発信者は「ええと、あの、その…えっと、ちょっと待って…そう、電話したのは、その、あの、予約がキャンセルされてしまって、どうすればいいか考えているんですが」と話します。文を始めては途中でやめ、また始めます。文の途中でコーヒーを一口飲みます。背景で赤ちゃんが泣いています。モデルが十分に学習していない地方訛りで話します。口座番号を調べる間に3秒間黙り、それから続けます。デモの制御された環境で成功していた音声エージェントは、その質感に初めて出会った瞬間に崩れてしまいます。
この問題は、すでに本番環境に入るまでほとんど目に見えません。だからこそ、ほとんどの運用担当者は、実際の顧客に提供して、それについて怒りのボイスメールを受け取り始めるまで、自社の音声AIのターンテイキングが悪いことに気づかないのです。
これらは、音声エージェントが実際の発信者に出会うと何度も繰り返し現れる失敗モードです。音声AI製品を使ってイライラしたことがあるなら、それはほぼ間違いなくこのどれかでした。
「割り込み屋」は、400msの間を検知してターンが終わったと思い込み、ユーザーの発話の途中で遮ります。発信者は「ええ、私は…」と言い、エージェントが割り込みます。「かしこまりました!口座番号をお願いします」。会話が始まる前から、発信者は聞いてもらえていないと感じます。
「応答が遅い者」はその逆をやります。発信者が文を言い終えると、2秒の沈黙があります。3秒目になって発信者は「もしもし?」と言います。エージェントが応答する頃には、信頼は失われています。会話は二度と完全には立ち直りません。
「話しかぶり屋」は、悪いビデオ通話の問題を音声の形にしたものです。双方が短く間を置きます。双方が同時に話し始めます。どちらも譲りません。双方が再び試みます。これを3回繰り返した後、発信者は電話を切ります。
「フィラー語食い」は、あらゆる「えー」をターンの終わりとして扱います。発信者は「えー、思うんですが…えっと…そう、予約したいんです」と言います。エージェントは最初の「えー」の後で割り込んで質問をやり直し、2つ目の後でもまた割り込み、発信者は実際の文を最後まで言い切ることができません。
「バージイン無視器」は、割り込まれても話すのをやめないモデルです。発信者はエージェントの応答が始まって10秒後に話し始めます。エージェントは話し続けます。発信者は声を張り上げます。エージェントは話し続けます。エージェントがようやく譲る頃には、発信者は怒っています。
「背景ノイズ混乱型」は、発信者の声以外のあらゆるものに惑わされます。赤ちゃんが泣き、ドアがバタンと閉まり、車のクラクションが鳴ると、エージェントは文の途中で止まって耳を澄まし、あるいはもっと悪いことに、何か新しいことが起きたと思い込んで現在の台詞をやり直します。
「早すぎるリカバリー型」は、発信者がまだそこにいるかどうかを絶えず確認します。発信者が3秒間考えるために間を置くと、エージェントは「まだいらっしゃいますか?」と言います。発信者が何かを調べるために再び間を置くと、同じ問いかけが返ってきます。3回目には、発信者は考えようとするのをやめてしまいます。
これらのどれもがターンテイキングの失敗です。どれも言語理解の問題ではありません。モデルはユーザーが何を言ったかを理解していました。ただ、いつそれを聞くべきか、あるいはいつ話すのをやめるべきかを分かっていなかっただけです。
優れたターンテイキングモデルは、いくつもの仕事を同時にこなしています。発信者の声のプロソディ、つまり「話し終えつつある」あるいは「まだ話し終えていない」を示すピッチとペースのわずかな変化を聞き取っています。統語的・意味的な完結を追跡しています。文が自然な終わりに達したのか、それともまだ途中なのか。個々の発信者のペースに適応しています。速くきびきび話す人もいれば、遅くとりとめなく話す人もおり、固定した間の閾値では少なくともどちらか一方に対応できないからです。バージインを聞き取っています。これは発信者の新しい発話を数十ミリ秒以内に捉え、気まずい重なりを残さずに自分の発話を止めることを意味します。そしてフィラー語や短いあいづち(「うん」「はい」「ええ」)を、本当のターン終了の合図と区別しています。
そのすべてが、エンドツーエンドで約600ミリ秒という応答レイテンシの予算の中で起きなければなりません。その閾値を超えると、発信者は遅延を感じ取り、会話は遅いビデオ通話のように感じられ始めます。その範囲内なら、発信者はエージェントが処理していることにまったく気づかなくなります。Retell のスタックは、LLM、音声認識、音声合成と協調したシステムとして動く独自のターンテイキングモデルによって、その基準を達成しています。独立したベンチマークではこの指標でトップに位置づけられており、遅い競合製品がまだ台本を読むチャットボットのように感じられる一方で、顧客が自社の Retell エージェントを人間のように感じると語る、最も多く挙げられる理由がこれです。
より深い論点はこうです。ターンテイキングの品質こそが、音声AIが単なる機能なのか、それとも体験なのかを決定づける変数なのです。世界で最も自然な音声と、利用可能な最も賢いLLMを備えていても、1回の通話で1つの悪いターンテイキングの判断があれば、そのすべてが台無しになります。
次に音声AIベンダーがデモを案内してくれるときは、この9つのことを意図的に負荷としてかけてみてください。優れたものは乗り切ります。見せかけのものは乗り切れません。
文の途中で3秒間の間を置き、エージェントが待つか割り込むかを見てください。1つの文を速く話し、次の文をとても遅く話して、モデルが適応するかどうかを見てください。エージェントが説明の途中にあるときに割り込もうとして、止まるまでにどれだけ時間がかかるか計ってください。エージェントが質問した後、5秒間完全に沈黙して、早々に諦めてしまわないかを見てください。発話をフィラー語(「えー、あの、なんか、つまり」)で埋め尽くし、エージェントが実際のターン終了を待つかどうかを見てください。同僚に背景で何かを短く言ってもらい、エージェントがそのノイズをどう扱うか観察してください。文の途中で大きく咳をして、エージェントがそれを沈黙として扱うか発話として扱うかを見てください。訛りのある話し方や小さな声で話して、聞き取りやすさが保たれるかを見てください。そして最後に、質問の次の部分を組み立てる間に目に見えて言いよどむほど複雑なことをエージェントに尋ねてください。
デモが9つすべてを乗り切るなら、あなたは本物の本番システムを見ています。3つ以上で崩れるなら、それに扮した制御された環境を見ているのです。
コンテインメント率はターンテイキングに依存します。CSATスコアもそうです。ブランドの印象もそうです。あなたを遮る音声は、間違った方向に威圧的に聞こえます。沈黙のまま座っている音声は無能に聞こえます。その両方を同時にやる音声は、発信者が言葉にはできないものの決して忘れないような形で、壊れているように聞こえます。
いま音声AIを評価していて、音声品質とLLMの選択でベンダーを比較してきたのなら、あなたは間違ったリーダーボードを見てきたことになります。音声品質はおおむね解決されています。LLMの選択はおおむねコストとレイテンシの判断です。ターンテイキングこそが実際の差別化が存在する場所であり、ほとんどの意思決定者がまだ名指しできない変数なのです。
ターンテイキングは会話型AIの地味なインフラです。デモしにくいため、デモされることはありません。ベンチマークがまだ成熟途上のため、ベンチマークされることもありません。しかしそれこそが、あなたの顧客が聞いてもらえていると感じるか遮られていると感じるか、あなたのエージェントが生き生きと感じられるか機械的に感じられるか、そしてあなたの音声AIプログラムが実際の発信者との接触を乗り切れるかを決定づけるのです。
正しい動きは、洗練されたデモを見るのをやめ、候補リストにあるすべてのベンダーで9項目の評価テストを実行し始めることです。ターンテイキングを第一級の問題として構築したプラットフォームはテストを乗り切ります。後付けで取ってつけたものは乗り切れません。
ライブデモ回線で Retell エージェントを試し、ご自身で評価テストを実行してください。dashboard.retellai.com で無料でアカウント作成し、実際の発信者が聞く前にプレイグラウンド内でストレステストしてください。あるいはデモを予約すると、私たちがあなたの目の前でエージェントをあえて壊そうと試みます。
出典:
AI搭載の音声エージェントに切り替えることで、あなたのビジネスがどれだけ節約できるかをご確認ください。
Total Human Agent Cost
AI Agent Cost
Estimated Savings
Retell クリニックオフィスのデモ電話番号

Start building smarter conversations today.


.avif)
.avif)