ほとんどの音声AIプラットフォームは、4つの要素を1つの分単価にバンドルしています。すなわち、音声認識(speech-to-text)、言語モデル、音声合成(text-to-speech)、そしてそれらをリアルタイム通話へと組み合わせるオーケストレーションです。テレフォニーはSIP経由で入ってきますが、キャリアの通話分数、エージェントが対話する各システム、そして会話ロジックそのものは、依然としてお客様側のものです。
これが答えのすべてです。この先のガイドは、評価段階で同じ疑問に何度もつまずいてしまう購入担当者向けです。「待って、テレフォニー、TTS、STT、LLMのために別々のサブスクリプションが必要なの? それともこれはもうプラットフォームに含まれているの?」
ベンダーとの商談で、音声AIプラットフォームをTwilio、ElevenLabs、OpenAIと並べて比較し、どれが安いのかと尋ねたことがあるなら、この記事が得られる最も明快な答えです。これらのベンダーは同じ列には並びません。それぞれがスタックの単一レイヤーを販売しているのです。 Retell AI のようなプラットフォームは、オーケストレーションされた全体を販売します。
お金でどのレイヤーを買っているのかを知ることで、4つの実務的な問いに答えが出ます。
電話に出るすべての音声エージェントは、同じ連鎖で動作します。音声が入ってくる。それが文字起こしされる。モデルがトランスクリプトを推論する。応答が読み上げられる。そのすべてが並行してストリーミングされます。
| レイヤー | 役割 | 一般的なプロバイダー |
|---|---|---|
| テレフォニー | 電話とサーバー間で音声をルーティングする | Twilio、Telnyx、Vonage、Avaya |
| 音声認識(STT) | 音声をテキストに変換する | Deepgram、AssemblyAI、Whisper |
| 言語モデル(LLM) | 読む、推論する、判断する、返答する | GPT-5、GPT-4o、Claude 4.5、Gemini 3.0 |
| 音声合成(TTS) | テキストを話し声の音声に変換する | ElevenLabs、Cartesia、OpenAI、MiniMax |
| オーケストレーション | ストリーミング、バッファリング、ターンテイキングとツール呼び出しの処理 | 音声AIプラットフォーム |
最初の4つはコモディティです。誰もがほぼ同じプロバイダーを使っています。5つ目こそ、自前で構築しようとしたときにチームがひそかに3〜6か月のエンジニアリングを燃やす部分です。
「自分たちでつなぎ合わせればいい」の隠れたコスト:ストリーミングWebSocket。文の境界でのバッファリング。音声区間検出。バージイン(割り込み)からの復旧。通話中のfunction calling。4つのAPIをまたいだリトライロジック。8 kHzコーデックの癖を扱うSIP統合。そのどれも箱から出してすぐには使えません。
いいえ。 プラットフォームを使うなら不要です。音声AIプラットフォームでは、1つの契約に署名し、1つの請求書を受け取ります。生のインフラを使うなら、4つに署名することになります。
実際の評価では、3つの購入パスが登場します。
1. バンドル型プラットフォーム: 1つの契約、1つの請求、1つのダッシュボード。ドロップダウンから音声とLLMを選び、プラットフォームがライセンス管理、API呼び出し、計量を処理します。ほとんどのチームが最初の90日間に選ぶのがこれです。
2. 生のインフラ: Twilio + STTプロバイダー + LLM API + TTSプロバイダーを、自前のオーケストレーションコードで接着します。最大限のコントロール、4組の認証情報、そして本番の通話を受けるまでに3〜6か月のエンジニアリング。
3. ハイブリッド(一部持ち込み): プラットフォームがオーケストレーションとコンポーネントを処理しますが、自前のSIPトランク、ファインチューニング済みモデル、または音声キーを持ち込みます。ほとんどの本番デプロイは最初の四半期を過ぎるとここに落ち着きます。
プラットフォームの表示レートはオーケストレーションをカバーします。コンポーネントはその上に乗り、隠れた手数料ではなく透明な明細項目です。
典型的なミッドマーケットの通話が、 料金ページでどう分解されるかは以下のとおりです。
| コンポーネント | 典型的なレート | 備考 |
|---|---|---|
| ベースのオーケストレーション | 約$0.07/分 | 固定 |
| 音声(Cartesia) | 約$0.05〜$0.07/分 | ElevenLabs/OpenAIはより高め |
| LLM | $0.003〜$0.08/分 | Gemini Flashが最安、GPT-5が最高 |
| テレフォニー(組み込み) | 約$0.015/分 | 自前のSIPトランクなら$0 |
| すべて込み(典型的) | $0.13〜$0.20/分 | 中位の音声 + 十分な性能のモデル |
財務向けにモデル化する前に、2つの注意点があります。
はい、そしてはい。すでにお持ちのものによります。
ダッシュボード内で直接電話番号を購入し、1時間以内に通話を受け始めることができます。また、既存のTwilio、Telnyx、Vonage、Avayaの番号をSIPトランキング経由で持ち込み、再販キャリアを完全に省くこともできます。どちらのパスも、その下で同じオーケストレーションレイヤーを使います。
手早い判断ルール:
後から切り替えることもできます。番号の再インポートは、移行計画ではなく数分で済みます。
いいえ。 ドロップダウンから選ぶ音声は、分単価に含まれています。
ElevenLabsが2つの異なる製品を販売しているため、多くの評価商談でこれが混乱を招きます。
音声AIプラットフォームを使っているなら、あなたが得ているのは#2です。別のAPIキーも不要。別のサブスクリプションも不要。別の請求書も不要。ライセンス管理と計量はバックエンドで行われます。
同じロジックがCartesia、OpenAI TTS、MiniMax、そしてプラットフォーム自身の音声モデルにも当てはまります。唯一の例外はエンタープライズ向けの音声クローニングで、ブランド固有の音声を必要とするチームには別途設定されます。
いいえ。 推論はバンドルされています。ドロップダウンからモデルを選ぶと、分単価が調整されます。
あなた側でのOpenAI APIキーは不要。Anthropicアカウントも不要。Google Cloudプロジェクトも不要です。
自前のモデル(ファインチューニング済みのウェイト、すでに署名済みのOpenAI Enterprise契約、あるいはセルフホストのLlamaデプロイ)を持ち込みたい場合、プラットフォームはカスタムLLM WebSocketをサポートしています。統合の手順は ドキュメントにあります。
自前モデルの持ち込みが正しい選択になるのはいつでしょうか?
それ以外の全員にとっては、バンドルされたパスの方がデプロイが速く、新しいモデルが登場したときの差し替えも容易です。
ここがチームの不意を突く部分です。プラットフォームは会話を処理します。あなたはそれが支える業務を担当します。
| あなたが用意するもの | プラットフォームが処理するもの |
|---|---|
| ナレッジベースのコンテンツ(サービスカタログ、価格、営業時間、ポリシー) | RAGの検索と自動同期 |
| CRMおよびシステム・オブ・レコード | 会話中のwebhook呼び出し |
| カレンダーおよび予約システム | リアルタイムの空き状況確認とイベント作成 |
| 会話フロー設計 | それを構築するドラッグ&ドロップのフレームワーク |
| エスカレーションのルールとルーティング | 完全なコンテキスト付きのウォームトランスファー(事前取次) |
表面化させておく価値のあるいくつかの注意点:
コストの差は小さい。時間の差は途方もなく大きい。
| バンドル型プラットフォーム | 自前持ち込みの構築 | |
|---|---|---|
| ベンダーとの関係 | 1 | 4以上 |
| 最初のライブ通話までの時間 | 1時間未満 | 3〜6か月 |
| 実質的な分単価コスト | $0.13〜$0.20 | $0.13〜$0.31 |
| 必要なエンジニアリング | プロンプト + フロー設計 | ストリーミングパイプライン + リトライロジック + 可観測性 + SIP処理 |
| コンプライアンスの連鎖 | 単一のBAA | スタック内のベンダーごとに1つ |
典型的な自前持ち込みの構築では、テレフォニーにTwilio、文字起こしにDeepgramまたはAssemblyAI、推論にGPT-5またはClaude 4.5、音声にElevenLabsまたはCartesia、オーケストレーションにPipecatまたはLiveKitを引っ張ってきます。分単価の計算は、バンドル型プラットフォームとほぼ同じ水準に落ち着きます。
自前で構築するときに支払うのはエンジニアリング時間です。音声区間検出、バージイン処理、通話中の障害を乗り越えるfunction calling、4つのベンダーのダッシュボードを1つのトレースに関連付ける可観測性、そしてテレフォニー音声の8 kHzコーデックの癖を優雅に処理するSIP統合。そのどれも箱から出してすぐには使えません。
最近の文字起こしモデルの大半は、主に16 kHzの音声で訓練されています。テレフォニーが手渡すのは8 kHzです。新たに構築したパイプラインでの精度の差は現実的で、発信者にもはっきり感じられます。
その数か月の配管作業と数日のプロンプトエンジニアリングとの差こそ、2026年に本番稼働する音声エージェントのほとんどがプラットフォーム上で提供される理由です。
Twilio、ElevenLabs、OpenAI、そしてRetell AIは、同じお金を奪い合っているのではありません。これらは同じアーキテクチャの中で積み重なったレイヤーです。
正しい捉え方は「Retell か Twilio か」ではまずありません。「Twilio の上に Retell」です。OpenAIやElevenLabsについても同じです。唯一本当に重なるのはオーケストレーションレイヤーであり、 Retell vs ElevenLabs のページが、プラットフォームとElevenLabs自身のエンドツーエンド製品との間で選ぼうとするチーム向けに、その狭い範囲の比較をカバーしています。
コンプライアンスはプラットフォームレイヤーに存在します。SOC 2 Type II、セルフサービスのBAAを備えたHIPAA、そしてGDPRが、分単位のコンプライアンス追加料金なしで含まれています。
これが最も重要になるのは、アンバンドルの構築です。つなぎ合わせたスタックでは、コンプライアンスはオーケストレーションでは止まりません。連鎖の中のすべてのベンダー(STT、LLM、TTS、テレフォニー)が、独自のBAAプロセス、独自のデータ取り扱い条件、独自の監査証跡を持っています。 ヘルスケア、 保険、 金融サービスの調達チームは、その理由だけでバンドルを選ぶのが通常です。
1つのベンダー承認は、4つよりも速く進みます。
3つのデプロイがトレードオフを具体的にします。
Anker: 音声自動化を、北米、欧州、アジアにまたがり年間数百万件の通話を処理するグローバルサポートセンター全体に展開。エージェントは英語圏市場で 95%超の音声認識精度を達成し、4ベンダーのパイプラインではなくAnker既存のテレフォニーの上で稼働しています。
Medical Data Systems: プラットフォームを通じた債権回収業務。チームは 現在、インバウンド通話の100%をわずか30%の転送率で処理し、毎月およそ$280,000を回収しています。その30%の転送率はプラットフォームのデフォルトではなく、ビジネス上の判断です。
Matic Insurance: サポート、予約確認、受付を処理する営業時間外のオペレーターボット。第1四半期に、このボットは 約8,000件の通話を処理し、その応答率は人間主導のベースラインを上回りました。ボットはMatic既存のTwilioとの関係の上に乗っています。
3社すべてに共通するパターン:
それが、実際の本番デプロイにおけるバンドル対自前持ち込みの境界線です。
音声AIプラットフォームを使うのにElevenLabsのサブスクリプションが必要ですか?
いいえ。音声は分単価に組み込まれています。例外はエンタープライズ向けの音声クローニングで、別途設定されます。
音声AIエージェントを動かすのにTwilioは必須ですか?
いいえ。ほとんどのプラットフォームは、直接トランキングを通じてTelnyx、Vonage、Avaya、およびあらゆるSIP対応キャリアをサポートし、加えて自社の組み込み番号も備えています。Twilioが話題を独占するのは、単にそれが最も一般的な既存キャリアだからにすぎません。
自前のLLMを持ち込めますか?
はい。カスタムLLMはWebSocket統合を通じてサポートされており、OpenAI Enterprise契約、Anthropic API、Gemini、セルフホストのモデルも含まれます。推論についてはモデルプロバイダーに、オーケストレーションについてはプラットフォームに支払います。
バンドル価格は、Twilio + OpenAI + ElevenLabs 上でのDIY構築と比べてどうですか?
実質的なすべて込みのコストは、ほぼ同じ範囲、すなわち1分あたり$0.13〜$0.31に収まります。分単位の経済性は決め手ではありません。決め手は、オーケストレーションレイヤーで節約できるエンジニアリング時間であり、それは通常数か月に及びます。
オーケストレーションレイヤーには何が含まれますか?
音声をチャンク単位でストリーミングすること、言語モデルとTTSの間の文境界バッファリング、ターンテイキングとバージイン、ライブ通話中のfunction calling、基盤となるAPIをまたいだリトライとフェイルオーバー、シミュレーションテスト、感情スコア付きのトランスクリプト、そして統合された可観測性ダッシュボードです。
音声AIプラットフォームをアウトバウンド発信に大規模に使えますか?
はい。バッチコールは、すべてのアカウントで20件の無料同時通話とともにアウトバウンドキャンペーンをサポートします。一般的なユースケースには、 AIテレマーケティング、 リード選別(リードクオリフィケーション)、債権回収のフォローアップ、予約リマインダーなどがあります。TCPAとSTIR/SHAKENのコンプライアンスはキャリアレベルで設定されます。
エージェントが通話を処理できないとき、何が起こりますか?
完全な会話コンテキストを備えたウォームトランスファー(事前取次)です。電話を引き継ぐ人間は、トランスクリプトとエージェントが収集した構造化データを確認できるため、発信者が同じことを繰り返す必要はありません。エスカレーションのしきい値(明確化の試みの失敗、機微なトピック、発信者からの明示的な要求)はエージェントごとに設定されます。
このプラットフォームは規制産業に適していますか?
はい。SOC 2 Type II、セルフサービスのBAAを備えたHIPAA、GDPR、そしてPIIの秘匿化(redaction)が含まれています。厳格なデータレジデンシー要件を持つチーム向けに、オンプレミスのデプロイも利用可能です。
サインアップからライブエージェントまでどれくらいかかりますか?
ほとんどのチームは1時間以内に動作するテスト通話を、1〜2週間以内に本番対応のエージェントを手にします。プラットフォームは 月間5,000万件超の通話を3,000社超のビジネスにわたって処理しているため、デプロイのパスはよく踏み固められています。
4つのリアルタイム要素(テレフォニー、文字起こし、言語モデル、音声合成)は急速にコモディティ化しています。誰でも購入できます。それらを、顧客に聞かせてもよいと思える電話通話に変えるオーケストレーションこそ、エンジニアリングが積み上がる部分であり、2026年に分単位のプラットフォーム料金を支払う価値がある理由です。
境界線がどこにあるかを最も速く体感する方法は、実際に通話をすることです。Retell AI のサインアップには$10分の利用クレジットが含まれており、自分の番号に対してテストエージェントをデプロイし、既存システムがどこで接続され、プラットフォームがどこをエンドツーエンドで処理するのかを見るのに十分です。
そこからの自然な次の一歩は、最も重要なワークフローが何であれ、それです。
retellai.com で$10分のクレジットを使って構築しましょう。
AI搭載の音声エージェントに切り替えることで、あなたのビジネスがどれだけ節約できるかをご確認ください。
Total Human Agent Cost
AI Agent Cost
Estimated Savings
Retell クリニックオフィスのデモ電話番号

Start building smarter conversations today.


.avif)
.avif)