AI音声エージェントにはどのLLMが最適か?2026年版・選定ガイド

AI音声エージェントにはどのLLMが最適か?2026年版・選定ガイド
ブログ一覧へ戻る
このページの目次
トップへ戻る

2026年、本番運用されるほとんどの音声AIエージェントにとって適切なLLMはGPT 4.1です。Retell AIプラットフォームで月間4,000万件超の通話を通じて最も使われているLLMであり、低レイテンシ、100万トークンのコンテキストウィンドウ、信頼性の高い関数呼び出しを、手頃な分あたりコストで両立しているからです。

このデフォルトを覆すのは、特定の制約によってそれが使えなくなる場合だけにしてください。

音声エージェントビルダーでモデルのドロップダウンを開くと、17個の選択肢が並んでいたはずです。

GPT 5.4、GPT 5.2、GPT 5.1、GPT 5、GPT 5 mini、GPT 5 nano、GPT 4.1、GPT 4.1 mini、GPT 4.1 nano、Claude 4.6 Sonnet、Claude 4.5 Sonnet、Claude 4.5 Haiku、Gemini 3.0 Flash、Gemini 2.5 Flash、Gemini 2.5 Flash Lite、さらに自前のカスタムモデル。

そのほとんどは、分あたりコストで数セントしか違いません。

本能的には、一番安いものを選んでうまくいくよう祈るか、最新のものを選んで、会話が遅くなりかねないモデルに倍の料金を払うかのどちらかになりがちです。

このガイドでは、どのLLMが電話エージェントにふさわしいかを決める4つの問いをたどり、続いてラインナップ各モデル、規模拡大時のコスト計算、そしてチームが選定時に犯しがちな最もよくある誤りを取り上げます。

2026年、AI音声エージェントに最適なLLMは何か?

2026年の本番運用の音声AIではGPT 4.1が勝ります。その理由は明確です。音声エージェントが直面する4つの制約を、同時にすべてクリアできる唯一のモデルだからです。

リアルタイム会話に十分な速さを持ち、標準ティアで最大のコンテキストウィンドウ(100万トークン)を備え、乱雑な電話音声をさばけるほど確実に指示に従い、規模拡大時にも妥当な価格に収まります。

より本質的な理由は、音声AIがテキストAIとは異なる能力の組み合わせを評価する点にあります。

テキストエージェントは3秒考えるために待ってもユーザーは気づきません。しかし3秒間沈黙する音声エージェントは電話を切られます。GPT 4.1は推論ステップを挟まずに指示追従とツール利用に最適化されており、それはまさに電話エージェントに必要なものです。

OpenAIのプロダクトチームがローンチ時に述べたとおり、このモデルは電話通話とほぼ正確に一致する、エージェント的で指示の多いワークロードを中心に作られています。

「新しいほど良い」という前提はここで崩れます。GPT 5.4はコードを書いたり複雑な問題を推論したりするのは確かに優れています。しかし4分間の予約受付通話では、発信者はそのIQの向上に気づきません。

気づくのは、各ターンで増える800ミリ秒のレイテンシのほうです。GPT 4.1がRetell AIプラットフォームで月間4,000万件超の通話を通じて最も使われているLLMであるのは、まさにアップグレードがレイテンシという代償に見合うことはめったにないとデータが示しているからです。

AI音声エージェントに適したLLMをどう選ぶか?

4つの問いに順番に答えてください。あなたのユースケースを止める最初の「はい」が、モデルを決める制約です。

その会話はレイテンシに敏感か?

はい、ほぼすべての電話通話がそうです。人間のやり取りは、間隔がおよそ250ミリ秒を超えると不自然に感じられ始め、約1.5秒を超える間は発信者の体験を実際に損ないます。Crestaのエンジニアが実際の本番通話を計測して記録したとおりです。

話す前に800ミリ秒から2秒の「考える」時間を加える推論モデルは、文の途中で何度も意識が飛ぶ人間のように聞こえます。

通話がリアルタイムで、発信者が回線の向こうで待っているなら、LLMには厳しいレイテンシの上限があります。それによりGPT 5.x、Claude Opus、そしてほとんどの思考モードモデルといった、遅めの推論バリアントは除外されます。選択肢はGPT 4.1、GPT 4.1 mini、GPT 5 mini、Gemini 3.0 Flash、Claude 4.5 Haikuへと絞られます。GPT 4.1はこのグループでも依然として安全なデフォルトです。「速い」モデルのスピードとフラッグシップ級の指示追従品質を兼ね備えており、これはあなたのAI電話応答サービスが、話の筋を見失わずに乱雑で割り込みの多い現実の音声をさばく必要があるときに効いてきます。

ユースケースがリアルタイムでないなら、次の問いに進んでください。アウトバウンドの留守番電話メッセージ、通話後の要約、非同期の通話後分析は、発信者を損なうことなく、より遅く賢いモデルを使えます。そこでは計算が逆転し、推論モデルがコストに見合い始めます。

その会話は長いコンテキストウィンドウを必要とするか?

ほとんどの通話は必要としません。典型的なインバウンドのサポート通話では、システムプロンプトが1,500〜4,000トークン、ナレッジベースの抜粋がさらに2,000〜6,000トークン、そしてトランスクリプトが10分目までにおそらく8,000トークンほどに増えます。これはどんな最新モデルのコンテキストにも余裕で収まります。

長いコンテキストが本当の制約になるのは、エージェントがあらゆる回答を大きなポリシー文書、アカウント履歴の全体、または複数通話にまたがる会話メモリに基づかせなければならない場合です。60ページのケアプランを参照する患者サービスエージェント、18か月分の支払い履歴をプロンプトに取り込む債権回収エージェント、または20万トークンの製品ドキュメントに基づくエンタープライズのAIカスタマーサポートエージェントは、余裕のあるモデルから恩恵を受けます。

GPT 4.1は100万トークンのコンテキストウィンドウを持ち、これは標準の本番ティアで最大です。GPT 5.4は27万で頭打ちになります。Claude Sonnet 4.6は20万で頭打ちです。Gemini 3 Flashも100万あります。最大の制約が「プロンプトに大量に読み込む必要がある」ことなら、最終候補はGPT 4.1とGemini 3 Flashの2つです。ほとんどのチームはGPT 4.1を採用します。長く乱雑な音声トランスクリプトでの指示追従の差が大きいからです。

その通話は多段階の推論や複雑なツール利用を必要とするか?

これはほとんどのチームが過大評価する問いです。慣れているからという理由で自分のユースケースを「複雑」だと思い込み、そして「Aetnaは使えますか」という質問に答えるのにエージェントが1.8秒かかったために発信者が電話を切るのを目にします。正直な検証方法はこうです。扱う最も多い通話タイプを3つ書き出し、エージェントが踏むステップ数を数え、有能な新人がこの仕事を難しいと呼ぶかどうかを問うてみてください。

定型的な予約受付、FAQ対応、リード選別、IVRの置き換えには推論モデルは不要です。必要なのは正確な関数呼び出し、速い応答、そして優れた割り込み復帰です。GPT 4.1はこの3つすべてを満たし、まさにこの理由でRetell AIプラットフォームで月間4,000万件超の通話を通じて最も使われているLLMです。

本当に複雑な仕事はアップグレードに値します。エージェントが3つか4つの関数呼び出しを連鎖させ、補償内容を推論しなければならない保険金請求のトリアージ、エージェントがその場でプランを比較するマルチ商品クロスセル、または複数のナレッジソースにまたがって問題を診断するテクニカルサポートなどです。そうした通話では、GPT 5.4、Claude Sonnet 4.6、または推論バリアントのいずれかにルーティングしてください。

本当に複雑なターンは、モデルがリアルタイムで頭をひねって考え抜こうとしてレイテンシを浪費させるのではなく、通話転送を使って人間にエスカレーションしてください。

分あたりの予算上限はどれほど厳しいか?

LLMコストは音声AI経済の小さいほうの半分です。Retell音声エンジンは1分あたり$0.07です。LLM推論は、最も安いモデルで1分あたり$0.005未満から、プレミアムモデルで1分あたり$0.06超まで上乗せされます。

テレフォニーは、Retell管理のTwilioを通じてさらに1分あたり$0.015を加えますが、自前のものを使えば無料です。妥当な規模であれば、「安いLLM」と「プレミアムLLM」の差は、オールインで1分あたり$0.10と$0.16の差にすぎません。

ほとんどのチームにとって正しい手は、GPT 4.1に少しだけ多く払い、封じ込め率が2%低くなる安いモデルを追わないことです。月に40,000分を運用しているなら、封じ込め率78%と73%の差は、LLMコストの差をはるかに上回ります。

安いLLMのペナルティは、転送された通話、再架電、そしてより多くの失敗モードを示す通話後の品質ダッシュボードという下流で現れます。

例外は、本当に大量かつ低複雑度のワークロードです。発信者を2ターンで適切な部署にルーティングするだけのシンプルなAI IVRは、GPT 4.1 mini、GPT 5 nano、またはGemini Flashで運用でき、封じ込め率に手を付けることなくLLMコストを1分あたり1セント未満に削減できます。コミットする前に、実際の通話トラフィックのサンプルでそのルートをテストしてください。

RetellでAI音声向けに利用できるLLMは何か?

これらはいずれもRetellのエージェントビルダーで利用できます。以下の注記はベンチマークのスコアではなく、電話通話での本番挙動を反映しています。

GPT 4.1(デフォルト)

ライブ通話におけるレイテンシ、コンテキスト、推論、コストの最良のバランス。100万トークンのコンテキストウィンドウ。強力な指示追従、信頼性の高い関数呼び出し、予測可能な応答時間。特定の制約でこれが使えなくなる場合を除き、これを使ってください。スケジューリング中心のユースケースには予約を取る機能との相性が良好です。

GPT 4.1 mini

同じファミリーのコスト最適化バリアント。入力トークンがおよそ4倍安価。長いマルチターンの会話ではやや弱いものの、メニュールーティングや基本的なFAQのような短く構造化された通話では見分けがつきません。通話構造が反復的な大量のAIテレマーケティングに適しています。

GPT 4.1 nano

このプラットフォームで最も安い実用的なモデルで、OpenAIの公開価格では入力トークン100万あたり$0.10と記載されています。言語検出、意図分類、通話ルーティングのような、本物の会話品質を必要としない些細なタスクに使ってください。顧客対応通話の主要エージェントモデルとしては推奨しません。

GPT 5.4 / GPT 5.2 / GPT 5.1

より強力な推論、より広範な世界知識、複雑な多段階の関数呼び出しが得意。その代償は各ターンで増えるレイテンシで、特に推論を有効にした場合に顕著です。これらは保険金請求処理やテクニカルサポートのような本当に複雑なフロー、または通話分析後のような、追加時間が発信者に見えない非同期のコールセンター自動化に使ってください。

GPT 5 mini / GPT 5 nano

GPT 5ファミリーの、より速く小さいバリアント。GPT 5 miniはGPT 4.1と同程度のレイテンシ特性を示しつつ、わずかに高いコストで少し優れた推論を備えます。通話の構成に推論の重いターンが多いなら、GPT 4.1とのA/Bテストの価値があります。GPT 5 nanoはコストの底値でGPT 4.1 nanoと競合します。

Claude Sonnet 4.6 / Claude Sonnet 4.5

エージェント的な設定での指示追従と構造化出力に最も強い。レイテンシは競争力がありますが、価格は高めです。入力トークン100万あたり$3に対しGPT 4.1は$2、出力トークン100万あたり$15に対し$8です。規制の厳しい保険向け会話型AIワークフローのように、エージェントが長く構造化されたシステムプロンプトを高い忠実度で守る必要があるときに使ってください。

Claude Haiku 4.5

コストティアのClaude。Sonnetより速く、安価ですが、長い会話やエッジケースの処理では明らかに弱めです。複数ルーティングの構成でフォールバックモデルとして有用です。

Gemini 3.0 Flash / Gemini 2.5 Flash / Flash Lite

ラインナップ中で最も低コストで、100万トークンのコンテキストと、異例なほど速いtime-to-first-tokenを備えます。自然な会話ターンでの品質は2026年に急激に改善しましたが、複雑な指示追従では依然としてGPT 4.1に及びません。最も強いユースケースは、最後の2%の精度よりもコンテキスト長とコストのほうが重要な、大量かつ検索の多いアプリケーションです。

カスタムLLM(自前持ち込み)

自前のモデルを持ち込めます。自社の通話データでモデルをファインチューニングした場合、セルフホストのLlamaやMistralバリアントを運用している場合、または特定のコンプライアンス制約がある場合に有用です。セットアップの複雑さは増しますが、Retellの請求からLLMの費目を完全に取り除けます。

実際の音声エージェントで各LLMの分あたりコストはどれくらいか?

月5,000分、平均通話時間4分、ナレッジベースを接続し、1ターンあたり1回の関数呼び出しがあるケースを取り上げます。

コンポーネントGPT 4.1構成GPT 5.4構成コスト極小構成
音声エンジン$0.07/分$0.07/分$0.07/分
LLM〜$0.025/分〜$0.06/分〜$0.005/分(4.1 nano)
テレフォニー(Retell Twilio)$0.015/分$0.015/分$0.015/分
オールイン〜$0.11/分〜$0.145/分〜$0.09/分
月額(5,000分時)〜$550〜$725〜$450

プレミアムモデル構成は5,000分時で月額$175多くかかります。コスト極小構成は$100節約します。どちらの方向でも、その差は人間のエージェント1人分のコスト(フルロードで月$3,000〜$4,000)に比べれば小さいものです。

正しい問いは「どれが一番安いか」であることはめったになく、「1ドルあたり最も高い封じ込め率をもたらすのはどれか」です。ほとんどのチームにとってその答えはGPT 4.1です。

あなた自身の数値については、価格ページにライブの計算機があり、LLM、音声プロバイダー、テレフォニー、アドオンを入れ替えて、構築前に自分の具体的な構成をモデル化できます。

音声AIのLLMを選ぶときに最もよくある誤りは何か?

デフォルトで一番安いモデルを選ぶ

表向きのLLMコストは、オールインの分あたり価格のごく一部です。1分あたり$0.005を節約して封じ込め率を5ポイント失えば、節約分より多くのコストがかかります。安いティアにコミットする前に、本番トラフィックで本物の比較を行ってください。

デフォルトで最新のモデルを選ぶ

新しいことは速いことではありません。GPT 5.xの推論モデルは、各ターンで数百ミリ秒を加えることがよくあります。30ターンある通話では、それは発信者が感じる30回の不自然な間になります。モデルはリリース日ではなく通話タイプに合わせてください。

すべての「複雑な」通話を複雑とみなす

複雑とラベル付けされた通話のほとんどは、おおむね80%が定型で、本当に難しいターンが1つか2つあるだけです。定型の部分はGPT 4.1にルーティングし、難しいターンはウォームハンドオフで人間にエスカレーションしてください。会話全体で推論モデルを動かすより、低コストで良い成果が得られます。

長いナレッジのユースケースでコンテキストウィンドウを無視する

80万トークンのポリシードキュメントを参照する必要があるエージェントを20万トークンのモデルで動かすと、コンテキストが無言で切り捨てられ、誤った回答を生み出します。システムプロンプト、取得したナレッジ、予測されるトランスクリプトの増加を含む実際のプロンプトサイズに、モデルのコンテキストウィンドウを合わせてください。

本物の本番A/Bを飛ばす

ベンチマークは、電話通話ではないタスクでモデルを順位付けします。重要な唯一のテストは、同じ発信者トラフィックで2つのモデルを1週間動かし、封じ込め率、転送率、CSATを比較することです。ほとんどのチームは、実トラフィックではGPT 4.1が好みの代替案に勝つか、引き分けることに気づきます。

どのチームがどのLLMを本番運用しているか?

Medical Data Systems

Retellプラットフォームで会話型AIを展開した後、MDSは現在インバウンド通話の100%をわずか30%の転送率で処理し、回収額を月およそ$280,000まで拡大しています。このエージェントは、アカウント照会と支払い処理のためのカスタム関数呼び出しを備えたGPT 4.1で動いています。

Pine Park Health

Pine Park Healthは、ヘルスケアでAI音声エージェントを使い、スケジューリングのNPSを38%向上させ、これまで活用しきれていなかった医療提供者の稼働枠を埋めました。このエージェントは患者とのやり取りを自然に保つために高速ティアのモデルで動いており、定型的なスケジューリング通話では推論モデルへのアップグレードによる測定可能なメリットは見つかりませんでした。

SWTCH

SWTCHのEV充電サポートエージェントは数秒で通話に応答し、サポートコストを50%超削減し、緊急のドライバー支援を大規模にさばきます。チームは、大量のユースケースでコストと会話品質の適切なトレードオフを得るために、バランスの取れたLLMティアを選びました。

よくある質問

2026年、AI音声エージェントに最適なLLMはどれか?

GPT 4.1は、2026年のほとんどの本番運用のAI音声エージェントにとってデフォルトの選択肢です。低レイテンシ、100万トークンのコンテキストウィンドウ、強力な指示追従、妥当な分あたりコストを両立しているため、Retell AIプラットフォームで月間4,000万件超の通話を通じて最も使われているLLMです。通話タイプが本当に多段階の推論を必要とするときだけ、より強力なモデルを使ってください。

音声エージェントにとってGPT 5.4はGPT 4.1より優れているか?

ほとんどのユースケースでは違います。GPT 5.4はより強力な推論とより広範な世界知識を持ちますが、その推論ステップが、発信者には不自然な間として感じられるレイテンシを加えます。予約受付、リード選別、FAQ対応のような定型の音声AIワークロードでは、GPT 4.1のほうが低価格で同等以上の発信者体験を生み出します。

LLMは分あたりの音声AIコストにどれくらい影響するか?

LLMコストは通常、最も安いモデルで1分あたり$0.005未満から、プレミアムティアで1分あたり$0.06超までの幅があります。音声エンジンとテレフォニーがさらに1分あたり$0.085を加えます。したがってGPT 4.1とGPT 5.4の選択は、オールインのコストをおよそ1分あたり$0.035、つまり5,000分のトラフィックで月$175変えます。

音声エージェントが目指すべきレイテンシはどれくらいか?

LLM推論、TTS、ネットワークを含め、エンドツーエンドで応答レイテンシ800ミリ秒未満を目指してください。1秒を超えると、会話は明らかに遅れて感じられます。1.5秒を超えると、発信者は電話を切り始めます。推論モデルは各ターンでこれらのしきい値を超えることがよくあり、それがGPT 4.1やGPT 5 miniのような高速ティアのモデルがライブの音声AIで主流である理由です。

GPT 4.1の代わりにClaude Sonnet 4.6を使うべきなのはいつか?

エージェントが長く構造化されたシステムプロンプトを高い忠実度で守る必要があるとき、特に規制されたワークフローでClaudeを使ってください。

Claude Sonnet 4.6は強力な指示追従を備えますが、入力トークンでおよそ50%、出力でほぼ2倍のコストがかかります。ほとんどのAI音声エージェントでは、価格と品質のトレードオフはGPT 4.1に有利です。

音声エージェントでカスタムまたはセルフホストのLLMを使えるか?

はい。Retellを含むほとんどの音声AIプラットフォームは、自前のファインチューニング済み、オープンソース、またはセルフホストのモデルを持ち込めるカスタムLLMエンドポイントをサポートしています。

これは、コンプライアンスに敏感なワークロード、過去の通話データで訓練したファインチューニング済みモデル、またはすでに別の場所で推論キャパシティに支払っているチームに有用です。

LLMの選択は関数呼び出しの信頼性に影響するか?

はい、大きく影響します。関数呼び出しの信頼性は、ベンチマークのスコアが示唆する以上にばらつきます。GPT 4.1とGPT 5.xは、マルチターンの関数呼び出しで最も高い成功率が文書化されています。Claude Sonnet 4.6はそれに僅差で続きます。

nanoやliteティアのような小さいモデルは、会話品質が問題なく見えても、封じ込め率を損なう程度まで関数呼び出しの信頼性を下げることがあります。

通話タイプごとに異なるLLMを使うべきか?

ほとんどのチームにとっては、いいえ。1つのモデルを選び、その周りでプロンプトをチューニングするほうがシンプルで信頼性が高いです。

複数モデルのルーティングが、その工数に見合うのは、シンプルな経路確認と複雑な再ルーティングの判断が混在する配車サービスのように、明確に異なる通話タイプを大量にさばく場合だけです。それ以外は、GPT 4.1を全面的に動かし、難しいターンを人間にエスカレーションしてください。

推論モード型のモデルは音声AIでどう異なる挙動をするか?

推論を有効にしたGPT 5や拡張思考を有効にしたClaudeのような推論モード型のモデルは、出力を生成する前に内部の熟考ステップを加えます。そのステップは、クエリに応じて数百ミリ秒から数秒かかります。

電話通話では、発信者はこの間に何も聞こえず、接続が切れたと思い込みます。ほとんどの音声AI導入は、推論を無効にするか、非推論モデルを選ぶかのどちらかです。

実際の音声トラフィックでLLMをどうA/Bテストするか?

インバウンドトラフィックを少なくとも1週間、2つのモデルで50/50に分け、それ以外はすべて一定に保ちます。同じプロンプト、同じ音声、同じテレフォニー、同じナレッジベースです。封じ込め率、平均通話時間、転送率、そしてCSATまたは通話後の感情を比較してください。勝者がベンチマークのスコアが最も高いモデルであることはめったにありません。あなたの具体的な通話構成で、最良の会話成果を出すモデルです。

次のステップ

これであなたは、自分の具体的な音声AIワークロードのレイテンシ、コンテキスト、推論、コストのプロファイルに合うLLMを選ぶための枠組みを手にしました。

ほとんどのチームにとって正しい出発点はGPT 4.1で、3週目に実際の本番トラフィックで1つの代替案に対するA/Bテストを計画するのがよいでしょう。

さらに深掘りするなら、次の判断は、LLMと組み合わせる音声プロバイダーをどれにするか、CRMとカレンダー向けに関数呼び出しをどう設定するか、そして何が機能しているかを測定できるようエージェントをどう計測するかです。それぞれがLLMの選択と相乗します。

遅い音声プロバイダー上のプレミアムモデルは、やはり遅く感じられます。優れた関数呼び出しを備えた安いモデルは、もろい連携を抱えたプレミアムモデルを上回ることがあります。

retellai.comで$10の利用クレジットを使い、無料で構築を始めましょう。

ROI計算ツール
通話の自動化によるROIを試算

AI搭載の音声エージェントに切り替えることで、あなたのビジネスがどれだけ節約できるかをご確認ください。

完了しました! 
送信内容がメールに届いています
エラーが発生しました。フォームの送信中に問題が起きました。
   1
   8
20
エラーが発生しました。フォームの送信中に問題が起きました。

ROI結果

2,000

Total Human Agent Cost

$5,000
/month

AI Agent Cost

$3,000
/month

Estimated Savings

$2,000
/month
ライブデモ
ライブデモを試す

Retell クリニックオフィスのデモ電話番号

ありがとうございます!送信が完了しました!
エラーが発生しました。フォームの送信中に問題が起きました。

Read Other Blogs

Revolutionize your call operation with Retell