「こんにちは」とエージェントの返答の間で何が起きているのかを、平易な言葉で。専門用語も曖昧なごまかしもなし。
リアルタイム音声AIは、その周りに2つのオーケストレーションを伴う3段階のパイプラインです。音声が入ってくる → 音声テキスト変換がそれを言葉に変える → LLM が何をすべきかを決める → テキスト音声変換が返答を再び音声に変える。そのすべてを包むのが、ターンテイキング(発信者はいつ話し終えたのか?)と割り込み処理(相手が遮ってきたらどうするか?)です。それがすべてです。
パイプライン全体が約700ms未満で完了しなければ、人間らしさが失われます。その閾値を超えると、発信者はぎこちなくなり、言い直し、電話を切ってしまいます。それを下回ると、AIと話していることを忘れます。Retell のスタックはエンドツーエンドで約600msで動作します。これは偶然ではありません。各段階が前の段階の完了を待つのではなく、次の段階へストリーミングしている結果です。
レイテンシの大部分は、予想しないところに隠れています。STT でもなく、TTS でもなく、ターンテイキングの判断と LLM の最初のトークンまでの時間に隠れています。自分のビルドが遅く感じるなら、まずこの2か所を確認すべきです。
ストリーミングがコツです。STT は完全な文を待つのではなく、約50msごとに部分的な書き起こしを出力します。LLM は生成されるそばからトークンをストリーミングします。TTS は返答全体が存在する前に音声チャンクをストリーミングします。いずれか1つの段階が前の段階の「完了」を待つと、これは一切機能しません。
2026年のスタックは、アーキテクチャ的にはどれも似通っています。「本番グレード」と「デモ」を分けるのは、オーケストレーションの品質です。VAD のチューニング、ターンテイキングモデル、割り込み処理、関数呼び出しのレイテンシ。実際のエンジニアリング投資はそこに注がれます。
マーケティングを剥ぎ取れば、音声エージェントはパイプラインです。音声が電話越しに入ってくる。ソフトウェアがそれをテキストに変える。言語モデルがそのテキストを読み、何を言うか、何をするかを決め、返答を生成する。別のソフトウェアが返答を再び音声に変える。音声が電話越しに出ていく。発信者がそれを聞き、何かを言うと、ループがもう一度回る。それだけです。それが製品のすべてです。
そのシンプルなループを機能させるのに何年もかかった理由は、そのすべてが1秒未満で起こらなければならないからです。パイプラインのあらゆる部分がストリーミングでなければなりません。各段階間のすべての移行がほぼ瞬時でなければなりません。2つの段階は厳しいリアルタイムの判断を下さなければなりません。ターンテイキング(「発信者はもう話し終えたのか?」)と割り込み処理(「発信者が私に重ねて話し始めた、どうすればいい?」)です。どれか1つでも間違えると、たとえ発信者がその理由を言葉にできなくても、彼らがすぐに気づく形で会話が崩れてしまいます。
本記事は、2026年に音声エージェントが実際にどう機能するかの、マーケティング抜きのバージョンです。単一の会話ターンをエンドツーエンドでたどり、レイテンシがどこに隠れているかを見て、本番スタックとデモを分けるオーケストレーションについて語り、内部で実際に起きていることについてのよくある誤解をいくつか正します。
エンジニアが何を作っているのかを理解しようとしている PM なら、本記事はあなたのためのものです。プラットフォームと自社開発を比較検討しているエンジニアなら、これもあなたのためのものです。いずれにせよ、読み終える頃には、誰かが「こんにちは」と言ってAIが「やあ」と返すたびに何が起きているのかがわかるでしょう。
これがエレベーターピッチ版です。
音声エージェントとは、一列に並んだ3つのものと、その周りを包む2つのものです。一列に並んだ3つ:STT → LLM → TTS。音声テキスト変換が発信者の音声を言葉に変えます。大規模言語モデルがそれらの言葉(に加えてシステムプロンプト、これまでの会話、エージェントが呼び出せるツールの説明)を読み、話すか関数を呼び出すかを決めます。テキスト音声変換がモデルの返答を再び音声に変えます。
そのパイプラインを包む2つのもの:ターンテイキングと割り込み。ターンテイキングは、発信者が考えを言い終えたタイミングを判断してエージェントが応答できるようにするシステムです。これは聞こえるよりずっと難しいのです。人間は文の途中で頻繁に間を取るからです。割り込みは、発信者がエージェントの返答の途中で遮るのを処理するシステムです。これも聞こえるより難しいのです。TTS を即座に止め、モデルが言おうとしていたことを破棄し、再び聞き始めなければならないからです。
なぜこれが難しいのか:各段階がストリーミングでなければならず、各段階には超えられないレイテンシ予算があります。ループ全体を約700ms未満に収めれば、会話は人間らしく感じられます。それを超えるとそうはなりません。それが仕事のすべてです。
1つの会話ターンをエンドツーエンドでたどってみましょう。発信者が「こんにちは、来週の火曜日の午後に清掃を予約したいのですが」と言う。そして600ms後、エージェントが返答する。その間に起こるすべてをここで見ていきます。
通話はまずテレフォニーレイヤーに到達します。既存のキャリアを使っているなら SIP トランク、Retell の番号を使っているなら WebRTC ストリームです。いずれにせよ、発信者の音声は通常それぞれ20msの小さなパケットのストリームとして現れます。発信者が話し始めた瞬間から、それらのパケットは回線速度でスタックに流れ込みます。ネットワークの往復は、ごまかせないレイテンシ予算の最初の部分です。地理やキャリアにもよりますが、AIの処理が何も行われる前の時点で、通常30〜80msです。
VAD は、入ってくる音声が音声なのか無音なのかを判断する軽量なモデルです。入ってくるすべてのチャンクに対して、ミリ秒単位で動作します。なぜわざわざ?理由は2つ。1つ:無音を STT に送りたくないからです。計算を無駄にし、ターンテイキングを混乱させます。2つ:VAD は、発信者がいつ話を止めたかを判断するためにターンテイキングが使う最初のシグナルです。質の悪い VAD は音声AIの静かな殺し屋の1つです。きつくチューニングしすぎると発信者を言葉の途中で遮り、緩くしすぎるとエージェントが鈍く感じられます。本番グレードのスタックは、これに汎用的なエネルギー閾値ではなく、電話通話の音声に特化して訓練された小さなニューラルネットを使います。
VAD が「これは音声だ」と言うやいなや、音声はストリーミング STT エンジンに送り込まれます。キーワードはストリーミングです。STT は発信者が話し終えるのを待ちません。約50msごとに部分的な書き起こし、つまりより多くの音声が届くにつれて修正される不完全な推測を出力します。そのため、200msの時点では書き起こしは「こんにちは、よ」かもしれません。400msで「こんにちは、予約したいのは清」。700msで完全な文です。現代の STT は、ダイアライゼーション(誰が話しているか、回線に複数の人がいるときに役立つ)、暫定的な修正(より多くのコンテキストが届くと「2時」を「2時半」に修正する)、スピーカーフォンや空港にいる発信者向けのノイズ耐性も扱います。
自作のビルドの大半が静かに失敗する場所はどこかと考えているなら、ここがその1つです。2026年には認識精度は問題ありません。難しいのは、ストリーミング、部分結果、発話終了の検出であり、これらはどれも汎用的な「この音声ファイルを書き起こす」APIからは得られません。
これが闇の芸術です。ターンテイキングは、発信者が考えを言い終えたタイミングを判断してエージェントが応答できるようにするモデルです。それは単なる「最後の言葉の後500ms待つ」ではありません。人間は文の途中で間を取り、息を吸い、考えながら「ええと」と言います。素朴なタイムアウトは、彼らを遮るか(「こんにちは、予約したいのは——」「わかりました、何を予約しますか?」)、遅く感じさせるか(「……来週の火曜日の午後に。」[沈黙][沈黙]「承知しました、確認します。」)のどちらかになります。
2026年の本番向けの答えは、音声ストリーム、部分的な書き起こし、会話のコンテキストを受け取り、発信者がターンを終えた確率を返す、小さく高速なニューラルなターンテイキングモデルです。毎秒数十回更新されます。確信度が閾値を超えると、エージェントのターンが始まります。Retell のターンテイキングモデルは、バックチャネル(「うんうん」「なるほど」)、ためらいの間、発話終了の検出を、おおよそ600msのエンドツーエンドの応答予算の中で扱います。(当社のターンテイキングの仕組み。)
本記事から1つだけ持ち帰るなら:「人間らしく感じる」と「ロボットのように感じる」の差の大半は、この段階に宿っています。レイテンシ予算の面では、ターンテイキングは合計応答時間の150〜300msを食います。品質の面では、発信者がエージェントを尊重するかどうかを左右する単一最大の要因です。
発信者のターンが終わると、言語モデルは必要なものすべて、すなわちシステムプロンプト、会話の全書き起こし、ナレッジベースから取得した知識、利用可能な関数のリストとともに呼び出されます。モデルはすべてのターンで2つの選択肢を持ちます。発話された返答を生成するか、ツールを呼び出すか(予約を取る、通話を転送する、顧客レコードを調べる)です。
ここで重要なレイテンシ指標は最初のトークンまでの時間(TTFT)です。返答全体にかかる時間ではなく、最初の単語がストリーミングを始めるまでの時間です。優れた2026年の LLM は、典型的な音声エージェントのプロンプトで TTFT を150〜300msで達成します。トークンがストリーミングを始めると、毎秒50〜100の速度で流れ続けます。これはほとんどの人が話すより速い速度です。そのため、TTS の段階はモデルが考え終える前に始まります。(LLM ティアの料金詳細。)
モデルが話す代わりに関数を呼び出すと決めた場合、別のレイテンシを支払います。webhook への往復(Cal.com での枠の予約、Salesforce へのリードの書き込み)です。ほとんどのプリセット関数では、これは速く、数百ミリ秒の一桁台です。遅いサードパーティ API の場合は遅くなることがあり、エージェントは通常「確認しますので少々お待ちください」のようなことを言ってその隙間を埋めます。(予約、転送、ナレッジベース。)
LLM が最初の数トークンを出力するやいなや、TTS が始まります。現代の音声エージェントは200〜400msのチャンクで音声をストリーミングで送り出すため、発信者は返答全体がまだ生成されていないうちに最初の単語を聞きます。これがパイプライン全体を速く感じさせるコツです。各段階が前の段階の完了前に出力を出すのです。
2026年の音声メニューには3つのティアがあります。高速・自然・低レイテンシを $0.015/分で実現する Retell プラットフォーム音声と Cartesia、最高品質のブランド音声を $0.040/分で提供する ElevenLabs、そしてプレミアムなユースケース向けの音声クローンのロングテールです。最初の音声までの時間(TTFA)が注目すべき指標で、本番スタックは100〜200msを達成します。デフォルト音声を使ったブラインドテストでは、ほとんどの発信者は人間と確実に区別できません。2026年に音声AIだとわかってしまうのは、もはや音声ではありません。タイミングです。
上記のパイプラインは、発信者が人間が実際にやること、つまり割り込みをするまでは見事に機能します。彼らはエージェントに重ねて話し始めます。火曜日ではなく水曜日のつもりだったと気づいたのかもしれません。いらだっているのかもしれません。いずれにせよ、エージェントはただちに話すのをやめ、計画していた返答の残りを破棄し、再び聞き始めなければなりません。素早く。
これが割り込み処理であり、音声AIのもう1つの静かな殺し屋です。素朴なビルドは、発信者が話している間も TTS の残りを読み上げ続けます。電話通話で最悪の感覚です。優れたビルドは、1つの音声チャンク以内(100ms未満)に TTS を断ち切り、LLM が言おうとしていたものを破棄し、発信者の新しい音声から新たな STT ストリームを始めます。モデルが断ち切られる前に何が言われたかを把握していて言い直さなければ、ボーナスポイントです。
予算を足し合わせると:ネットワーク(50ms)+ VAD/ターンテイキング(200ms)+ LLM TTFT(250ms)+ TTS TTFA(100ms)= おおよそ600ms。それが音声エージェントが人間らしく感じる仕組みです。これらの数字に魔法めいたものは何もありません。積極的にストリーミングし、待つ必要のないものを何も待たないことの結果にすぎません。
まさにこのパイプライン上で今日稼働している3社、研究する価値があります。
Pine Park Health。シニア向け住宅コミュニティのプライマリケア。電話のかけ違いがスケジュールを圧迫していました。彼らはスケジューリング回線の前に Retell の音声エージェントを置きました。誰もが使うのと同じ STT → LLM → TTS パイプラインですが、発信者が離脱しないほど緊密にオーケストレーションされています。スケジューリングの NPS は38%上昇しました。臨床スタッフは1日の半分を電話に費やすのをやめました。
SWTCH。EV充電会社。ドライバーが故障した充電器のところで立ち往生しているとき、「明日折り返します」は答えになりません。彼らは Lucas、つまり Retell のエージェントを回線に置きました。Lucas は数秒で応答し、緊急のトラブルシューティングをドライバーに案内し、同じ7段階のパイプラインで24時間365日それを行います。サポートコストは50%以上下がりました。
Medical Data Systems。債権回収。規制が厳しく、トーンに敏感で、会話が脱線すると容赦がありません。彼らは Retell のエージェントをインバウンド通話に置き、今では着信量の100%を処理し、人間に転送される通話はわずか30%で、月におよそ $280,000 を回収しています。パイプラインは今たどったのとまったく同じものです。違いは、オーケストレーションの規律と、ターンテイキング・割り込み・プロンプト設計に関する小さな判断のロングテールです。(顧客事例はこちら。)
3社すべてに共通する糸:誰もパイプラインを発明しようとはしませんでした。オーケストレーションが解決済みのプラットフォームを選び、自社のビジネスに本当に固有の部分、すなわちプロンプト、ナレッジベース、関数のエンドポイントに作業を集中させ、出荷しました。
本記事から他に何も覚えていなくても、これだけは覚えておいてください:STT と TTS はレイテンシの大半が隠れている場所ではありません。それらは速いのです。レイテンシが実際に行く2か所は、ターンテイキングと LLM の最初のトークンまでの時間です。
これが本番スタックでの1つの会話ターンに対する2026年の典型的な予算の内訳です。
ネットワークの往復:30〜80ms。主に地理と SIP キャリア次第。ここでできることはあまりありません。
VAD + ターンテイキングの判断:150〜300ms。これが最大の変数です。質の悪いターンテイキングモデルは、ベンチマークには一切現れないまま、体感レイテンシで500ms以上のコストをもたらします。
STT の最終書き起こし:発話終了後50〜100ms。ストリーミングがこの大半を前の段階に隠します。
LLM の最初のトークンまでの時間:150〜400ms。モデルの選択とプロンプトのサイズに大きく依存します。
TTS の最初の音声までの時間:100〜200ms。
関数呼び出し(呼び出された場合):APIにより100〜500ms。
本番グレードのスタックは、これの話すか否かの部分を合計約600msで着地させます。平凡なスタックは1.2〜1.8秒で着地します。平凡なスタックは、台詞を読み上げるチャットボットと話しているように感じます。優れたものは、人間のように感じます。
最適化しようとするなら、大きなレバーは2つ:TTFT の低い高速な LLM を選ぶこと(GPT 4.1、Claude 4.6 Sonnet、Gemini 3.0 Flash はいずれも本番ターゲットを達成します)、そして固定の無音閾値ではなく、実際の会話データで訓練されたターンテイキングモデルを使うことです。(なぜレイテンシが重要なのか)
指摘する価値のあることがいくつかあります。
「単に3つのAPIを貼り合わせただけだ。」そうです、それをリアルタイムに感じさせようとするまでは。すると、貼り合わせ方がAPIそのものより重要だと気づきます。オーケストレーションレイヤー、つまり VAD のチューニング、ターンテイキングモデル、ストリーミングの協調、割り込み処理、関数呼び出しのルーティングこそが、本番グレードのスタックが実際に存在する場所です。STT ベンダーは1日で入れ替えられます。システムの半分を書き直さずにオーケストレーションを入れ替えることはできません。
「LLM が大きいほど、音声エージェントは良くなる。」そうとは限りません。ほとんどの音声ユースケースでは、良いプロンプトを備えた高速な中位モデルが、遅い旗艦モデルに勝ります。最初のトークンまでの時間が、生の推論品質よりも重要です。発信者の知覚はほとんど完全にレイテンシによって形作られるからです。Retell が LLM をドロップダウンで入れ替えられるようにしているのは、まさに正しい答えがユースケースに依存するからです。重い推論には Claude 4.6 Sonnet、大量・低コストには GPT 5 nano、多言語には Gemini 3.0 Flash、デフォルトは GPT 4.1 です。
「ストリーミングはあれば良い程度のものだ。」それがアーキテクチャそのものです。ストリーミングがなければ、発信者が話し終えるのを待ち、次に STT が終わるのを待ち、次に LLM が終わるのを待ち、次に TTS が終わるのを待つことになり、音声が1バイトでも返る前に3秒以上を費やしてしまいます。2026年の音声エージェントが人間らしく感じる理由のすべては、各段階が前の段階が終わる前に出力を出し始めることにあります。
「自分のユースケースで機能させるにはカスタム訓練したモデルが必要だ。」ほとんどの場合、いいえ。2026年のスタックは、モデルが汎用のままで、プロンプト+ナレッジベース+関数がカスタマイズを担うように設計されています。カスタム訓練したモデルは反復が遅く、推論も遅く、新しいベースモデルが出荷された瞬間に時代遅れになります。「カスタムモデルが必要だった」チームのほとんどは、実際にはより良いプロンプトとより良いナレッジベースが必要だっただけです。
「音声が最も難しい部分だ。」今やそれはむしろ最も簡単な部分の1つです。デフォルトの TTS 音声は、ブラインドテストでは機能的に人間と区別がつきません。最も難しい部分はターンテイキングと割り込み、つまり発信者が意識的には気づかないものの確実に感じ取るものです。
リアルタイム音声AIはストリーミングのパイプラインです:音声入力 → STT → LLM → TTS → 音声出力、それをターンテイキングと割り込みが包む。各段階は前の段階が終わる前に出力を出し、ループ全体が700ms未満で完了し、本番とデモを分けるのはオーケストレーションです。それがアーキテクチャです。魔法ではありません。いくつかの特定のエンジニアリング問題をうまく解決したものです。
ほとんどのオペレーターは、これを自分で構築する必要はありません。何を買っているのか、何を求めるべきか、間違ったベンダーを選んだらビルドがどこで失敗するのかを知るのに十分なほど、これを理解する必要があるだけです。本記事でその大半までたどり着けたなら、あなたは良い状態にあります。
パイプラインを実際に見たいなら、最も速い道はその上に何かを構築することです。dashboard.retellai.com で無料登録してください。新規アカウントには $10 分のクレジット、約90分の会話が付与されます。あるいはデモを予約すると、実際の通話量の文脈でオーケストレーションをご案内します。レイテンシをご自身の耳で確かめたいなら、ライブデモ回線にお電話いただき、上記のパイプライン上で動作するエージェントと話してみてください。
Q:STT → LLM → TTS とは実際にどういう意味ですか? A:音声AIパイプラインの3つの中核段階です。STT(音声テキスト変換)が発信者の音声をテキストに変えます。LLM(大規模言語モデル)がそのテキストとシステムプロンプトを読み、何を言うか、どの関数を呼び出すかを決めます。TTS(テキスト音声変換)が返答を再び音声に変えます。その周りにターンテイキングと割り込み処理を包めば、それがスタックのすべてです。
Q:リアルタイム音声AIはどれくらい速くある必要がありますか? A:会話が人間らしく感じられる閾値は、エンドツーエンドの応答時間で約700ms未満です。それを超えると、発信者は遮り始め、言い直し、電話を切ります。Retell のような本番スタックは約600msで動作します。
Q:レイテンシは実際どこへ行くのですか? A:主にターンテイキングと LLM の最初のトークンまでの時間であり、STT や TTS ではありません。典型的な予算:ネットワーク50ms、VAD/ターンテイキング200ms、LLM TTFT 250ms、TTS の最初の音声100ms。STT は発信者の発話と並行して動くため、上乗せはほとんどありません。
Q:ストリーミングとは何で、なぜ重要なのですか? A:パイプラインのすべての段階が、前の段階が終わる前に出力を出します。STT は約50msごとに部分的な書き起こしを出力します。LLM は生成されるそばからトークンをストリーミングします。TTS は200〜400msのチャンクで音声をストリーミングします。ストリーミングがなければ、すべての段階が前のものを待ち、音声が1バイトでも発信者に返る前に3秒以上を費やします。
Q:ターンテイキングとは何で、なぜ難しいのですか? A:ターンテイキングは、発信者が話し終えたタイミングを判断してエージェントが応答できるようにするシステムです。難しいのは、人間が文の途中で間を取り、息を吸い、考えながら「ええと」と言うからです。素朴なタイムアウトは発信者を遮るか、遅く感じさせます。2026年の答えは、実際の会話音声で訓練され、毎秒数十回確率を更新する小さなニューラルモデルです。
Q:割り込み処理とは何ですか? A:発信者がエージェントに重ねて話し始めたときに起こることです。優れたスタックは100ms以内に TTS を止め、計画していた返答の残りを破棄し、発信者の新しい音声から新たな STT ストリームを始めます。質の悪いスタックは話し続けます。電話通話で最悪の感覚です。
Q:パイプラインを自分で構築する必要がありますか? A:2026年にはほとんどありません。オーケストレーション、すなわち VAD、ターンテイキング、割り込み、ストリーミングの協調、関数呼び出しのルーティングこそが、本格的なエンジニアリング投資が注がれる部分です。自分で構築しようとするチームのほとんどは、市販で手に入るものの、より遅く、より劣ったバージョンにたどり着きます。自社のビジネスに固有の部分、すなわちプロンプト、ナレッジベース、関数のエンドポイント、ワークフローを構築してください。
Q:LLM の選択はそれほど重要ですか? A:はい、ただし主に最初のトークンまでの時間のためであり、生の品質のためではありません。ほとんどの音声ユースケースでは、良いプロンプトを備えた高速な中位モデルが遅い旗艦モデルに勝ります。Retell は LLM をドロップダウンで入れ替えられるようにしています。GPT 4.1 がデフォルト、より高い推論には Claude 4.6 Sonnet、安価な大量処理には GPT 5 nano、多言語には Gemini 3.0 Flash です。(料金。)
Q:関数呼び出しはパイプラインにどう組み込まれますか? A:LLM が話す代わりに関数を呼び出すと決めると、プラットフォームはモデルが会話から抽出した構造化された引数とともに HTTPS の webhook を発火させ、応答を待ちます。その往復はレイテンシを加えます。高速な API では通常数百ミリ秒、遅いものではそれ以上です。待ちが長い場合、エージェントは通常「確認しますので少々お待ちください」と言って隙間を埋めます。
Q:音声AIと IVR の違いは何ですか? A:IVR は固定の決定木です(請求は1を押してください)。音声AIは上記のパイプライン上で動作します。自由形式の発話が入り、中間で LLM の推論があり、自然な返答が出ます。発信者はメニューをたどりません。ただ話すだけです。
AI搭載の音声エージェントに切り替えることで、あなたのビジネスがどれだけ節約できるかをご確認ください。
Total Human Agent Cost
AI Agent Cost
Estimated Savings
Retell クリニックオフィスのデモ電話番号

Start building smarter conversations today.


.avif)
.avif)