音声AIプラットフォームには何が含まれているのか? 電話(テレフォニー)、TTS、STT、LLM、そして自前で用意すべきもの

音声AIプラットフォームには何が含まれているのか? 電話(テレフォニー)、TTS、STT、LLM、そして自前で用意すべきもの
ブログ一覧へ戻る
このページの目次
トップへ戻る

ほとんどの音声AIプラットフォームは、4つの要素を1つの分単価にバンドルしています。すなわち、音声認識(speech-to-text)、言語モデル、音声合成(text-to-speech)、そしてそれらをリアルタイム通話へと組み合わせるオーケストレーションです。テレフォニーはSIP経由で入ってきますが、キャリアの通話分数、エージェントが対話する各システム、そして会話ロジックそのものは、依然としてお客様側のものです。

これが答えのすべてです。この先のガイドは、評価段階で同じ疑問に何度もつまずいてしまう購入担当者向けです。「待って、テレフォニー、TTS、STT、LLMのために別々のサブスクリプションが必要なの? それともこれはもうプラットフォームに含まれているの?」

ベンダーとの商談で、音声AIプラットフォームをTwilio、ElevenLabs、OpenAIと並べて比較し、どれが安いのかと尋ねたことがあるなら、この記事が得られる最も明快な答えです。これらのベンダーは同じ列には並びません。それぞれがスタックの単一レイヤーを販売しているのです。 Retell AI のようなプラットフォームは、オーケストレーションされた全体を販売します。

お金でどのレイヤーを買っているのかを知ることで、4つの実務的な問いに答えが出ます。

  • どの契約に署名するか
  • 毎月どの請求書を受け取るか
  • 本番稼働前にどのエンジニアリング工数を費やすか
  • 価格やモデルが変わったとき、スタックのどの部分を差し替えられるか

音声AIスタックを一目で

電話に出るすべての音声エージェントは、同じ連鎖で動作します。音声が入ってくる。それが文字起こしされる。モデルがトランスクリプトを推論する。応答が読み上げられる。そのすべてが並行してストリーミングされます。

レイヤー役割一般的なプロバイダー
テレフォニー電話とサーバー間で音声をルーティングするTwilio、Telnyx、Vonage、Avaya
音声認識(STT)音声をテキストに変換するDeepgram、AssemblyAI、Whisper
言語モデル(LLM)読む、推論する、判断する、返答するGPT-5、GPT-4o、Claude 4.5、Gemini 3.0
音声合成(TTS)テキストを話し声の音声に変換するElevenLabs、Cartesia、OpenAI、MiniMax
オーケストレーションストリーミング、バッファリング、ターンテイキングとツール呼び出しの処理音声AIプラットフォーム

最初の4つはコモディティです。誰もがほぼ同じプロバイダーを使っています。5つ目こそ、自前で構築しようとしたときにチームがひそかに3〜6か月のエンジニアリングを燃やす部分です。

「自分たちでつなぎ合わせればいい」の隠れたコスト:ストリーミングWebSocket。文の境界でのバッファリング。音声区間検出。バージイン(割り込み)からの復旧。通話中のfunction calling。4つのAPIをまたいだリトライロジック。8 kHzコーデックの癖を扱うSIP統合。そのどれも箱から出してすぐには使えません。

テレフォニー、TTS、STT、LLMのために別々のサブスクリプションが必要ですか?

いいえ。 プラットフォームを使うなら不要です。音声AIプラットフォームでは、1つの契約に署名し、1つの請求書を受け取ります。生のインフラを使うなら、4つに署名することになります。

実際の評価では、3つの購入パスが登場します。

1. バンドル型プラットフォーム: 1つの契約、1つの請求、1つのダッシュボード。ドロップダウンから音声とLLMを選び、プラットフォームがライセンス管理、API呼び出し、計量を処理します。ほとんどのチームが最初の90日間に選ぶのがこれです。

2. 生のインフラ: Twilio + STTプロバイダー + LLM API + TTSプロバイダーを、自前のオーケストレーションコードで接着します。最大限のコントロール、4組の認証情報、そして本番の通話を受けるまでに3〜6か月のエンジニアリング。

3. ハイブリッド(一部持ち込み): プラットフォームがオーケストレーションとコンポーネントを処理しますが、自前のSIPトランク、ファインチューニング済みモデル、または音声キーを持ち込みます。ほとんどの本番デプロイは最初の四半期を過ぎるとここに落ち着きます。

分単価には何が含まれていますか?

プラットフォームの表示レートはオーケストレーションをカバーします。コンポーネントはその上に乗り、隠れた手数料ではなく透明な明細項目です。

典型的なミッドマーケットの通話が、 料金ページでどう分解されるかは以下のとおりです。

コンポーネント典型的なレート備考
ベースのオーケストレーション約$0.07/分固定
音声(Cartesia)約$0.05〜$0.07/分ElevenLabs/OpenAIはより高め
LLM$0.003〜$0.08/分Gemini Flashが最安、GPT-5が最高
テレフォニー(組み込み)約$0.015/分自前のSIPトランクなら$0
すべて込み(典型的)$0.13〜$0.20/分中位の音声 + 十分な性能のモデル

財務向けにモデル化する前に、2つの注意点があります。

  • $0.07という入り口の価格は、$0.07の本番コストではありません。表示価格はオーケストレーションのみをカバーします。
  • アドオンは分単価の外にあります。ストリーミング型のナレッジベース(最初の10件は無料、その後は約$0.005/分)、20通話を超える同時実行、ブランド化された発信者番号(caller ID)など。いずれも稼働に必須ではありません。

テレフォニーはバンドルされていますか、それともやはりTwilioが必要ですか?

はい、そしてはい。すでにお持ちのものによります。

ダッシュボード内で直接電話番号を購入し、1時間以内に通話を受け始めることができます。また、既存のTwilio、Telnyx、Vonage、Avayaの番号をSIPトランキング経由で持ち込み、再販キャリアを完全に省くこともできます。どちらのパスも、その下で同じオーケストレーションレイヤーを使います。

手早い判断ルール:

  • ゼロから始める? 組み込みの番号を使いましょう。より速く、より安く、キャリアのセットアップも不要。
  • 既存のキャリア契約やポート済みの番号がある? 自前のSIPトランクを持ち込みましょう。レート、STIR/SHAKENの認証(attestation)、DIDのポートフォリオを維持できます。
  • すでにTwilio統合に深く踏み込んでいる? 同じ答えです。トランクをプラットフォームに向け、番号をインポートしてください。

後から切り替えることもできます。番号の再インポートは、移行計画ではなく数分で済みます。

ElevenLabsに別途支払う必要がありますか?

いいえ。 ドロップダウンから選ぶ音声は、分単価に含まれています。

ElevenLabsが2つの異なる製品を販売しているため、多くの評価商談でこれが混乱を招きます。

  • 自社のエンドツーエンドのConversational AI製品(直販、約$0.10/分にLLMコストが加わる)
  • その音声モデル。これらを組み込んで分単位で再販するプラットフォームにライセンス供与

音声AIプラットフォームを使っているなら、あなたが得ているのは#2です。別のAPIキーも不要。別のサブスクリプションも不要。別の請求書も不要。ライセンス管理と計量はバックエンドで行われます。

同じロジックがCartesia、OpenAI TTS、MiniMax、そしてプラットフォーム自身の音声モデルにも当てはまります。唯一の例外はエンタープライズ向けの音声クローニングで、ブランド固有の音声を必要とするチームには別途設定されます。

LLMのためにOpenAIのサブスクリプションが必要ですか?

いいえ。 推論はバンドルされています。ドロップダウンからモデルを選ぶと、分単価が調整されます。

  • 最安: Gemini 3.0 Flash、GPT-5 Nano(1セントの何分の1か)
  • 中位: GPT-4o、Claude Haiku
  • 推論重視: Claude 4.5 Sonnet、GPT-5

あなた側でのOpenAI APIキーは不要。Anthropicアカウントも不要。Google Cloudプロジェクトも不要です。

自前のモデル(ファインチューニング済みのウェイト、すでに署名済みのOpenAI Enterprise契約、あるいはセルフホストのLlamaデプロイ)を持ち込みたい場合、プラットフォームはカスタムLLM WebSocketをサポートしています。統合の手順は ドキュメントにあります。

自前モデルの持ち込みが正しい選択になるのはいつでしょうか?

  • 厳格なデータレジデンシー要件
  • 収益化したい既存のLLMコミットメント
  • あなたのユースケースにおいて汎用モデルを実質的に上回るドメイン特化型のファインチューニング

それ以外の全員にとっては、バンドルされたパスの方がデプロイが速く、新しいモデルが登場したときの差し替えも容易です。

それでも自前で用意すべきもの

ここがチームの不意を突く部分です。プラットフォームは会話を処理します。あなたはそれが支える業務を担当します。

あなたが用意するものプラットフォームが処理するもの
ナレッジベースのコンテンツ(サービスカタログ、価格、営業時間、ポリシー)RAGの検索と自動同期
CRMおよびシステム・オブ・レコード会話中のwebhook呼び出し
カレンダーおよび予約システムリアルタイムの空き状況確認とイベント作成
会話フロー設計それを構築するドラッグ&ドロップのフレームワーク
エスカレーションのルールとルーティング完全なコンテキスト付きのウォームトランスファー(事前取次)

表面化させておく価値のあるいくつかの注意点:

  • ナレッジベースはウェブサイトや文書セットから自動同期しますが、それらの文書のコンテンツを最新に保つのはあなたの役目です。ゴミを入れればゴミが出る、どのRAGシステムでも同じです。
  • CRM統合はwebhook、Make、n8n、Zapier、またはネイティブの HubSpot統合を通じて動作します。エージェントはライブ通話中にSalesforceやHubSpotの読み書きができますが、スキーマと権限はあなたの側にあります。
  • 予約を取るフローについては、統合はCal.com、Google Calendar、Calendly、またはあなたの記録用カレンダーを保持しているいずれかの予約システムに対して動作します。
  • AIアポイント獲得エージェント AI電話応答サービス、インバウンドサポートといった一般的なパターンにはテンプレートが存在しますが、エージェントが実際に尋ねる質問や、何を「選別されたリード」とみなすかは、あなたにしか下せない判断です。
  • 通話転送のエスカレーションについては、しきい値をあなたが定義します。本番デプロイでは、インバウンド通話の 最大80パーセントを日常的に自動化していますが、AIと人間の境界線をどこに引くかはあなたの判断です。

バンドル vs. 構築:正直な比較

コストの差は小さい。時間の差は途方もなく大きい。

バンドル型プラットフォーム自前持ち込みの構築
ベンダーとの関係14以上
最初のライブ通話までの時間1時間未満3〜6か月
実質的な分単価コスト$0.13〜$0.20$0.13〜$0.31
必要なエンジニアリングプロンプト + フロー設計ストリーミングパイプライン + リトライロジック + 可観測性 + SIP処理
コンプライアンスの連鎖単一のBAAスタック内のベンダーごとに1つ

典型的な自前持ち込みの構築では、テレフォニーにTwilio、文字起こしにDeepgramまたはAssemblyAI、推論にGPT-5またはClaude 4.5、音声にElevenLabsまたはCartesia、オーケストレーションにPipecatまたはLiveKitを引っ張ってきます。分単価の計算は、バンドル型プラットフォームとほぼ同じ水準に落ち着きます。

自前で構築するときに支払うのはエンジニアリング時間です。音声区間検出、バージイン処理、通話中の障害を乗り越えるfunction calling、4つのベンダーのダッシュボードを1つのトレースに関連付ける可観測性、そしてテレフォニー音声の8 kHzコーデックの癖を優雅に処理するSIP統合。そのどれも箱から出してすぐには使えません。

最近の文字起こしモデルの大半は、主に16 kHzの音声で訓練されています。テレフォニーが手渡すのは8 kHzです。新たに構築したパイプラインでの精度の差は現実的で、発信者にもはっきり感じられます。

その数か月の配管作業数日のプロンプトエンジニアリングとの差こそ、2026年に本番稼働する音声エージェントのほとんどがプラットフォーム上で提供される理由です。

境界線はどこにあるか

Twilio、ElevenLabs、OpenAI、そしてRetell AIは、同じお金を奪い合っているのではありません。これらは同じアーキテクチャの中で積み重なったレイヤーです。

  • Twilio、Telnyx、Vonage → テレフォニー。電話とサーバー間で音声を運ぶ。
  • ElevenLabs、Cartesia、OpenAI TTS、MiniMax → 音声合成。テキストを話し声に変える。
  • OpenAI、Anthropic、Google → 言語モデルの推論。推論する頭脳。
  • Retell AI → オーケストレーションに加え、エージェントフレームワーク、 通話後分析 一括発信(バッチコール)、シミュレーションテスト、そして4つの請求書を1つに変える商業的なラッパー。

正しい捉え方は「Retell Twilio か」ではまずありません。「Twilio の上に Retell」です。OpenAIやElevenLabsについても同じです。唯一本当に重なるのはオーケストレーションレイヤーであり、 Retell vs ElevenLabs のページが、プラットフォームとElevenLabs自身のエンドツーエンド製品との間で選ぼうとするチーム向けに、その狭い範囲の比較をカバーしています。

HIPAA、SOC 2、GDPRはどうですか?

コンプライアンスはプラットフォームレイヤーに存在します。SOC 2 Type II、セルフサービスのBAAを備えたHIPAA、そしてGDPRが、分単位のコンプライアンス追加料金なしで含まれています。

これが最も重要になるのは、アンバンドルの構築です。つなぎ合わせたスタックでは、コンプライアンスはオーケストレーションでは止まりません。連鎖の中のすべてのベンダー(STT、LLM、TTS、テレフォニー)が、独自のBAAプロセス、独自のデータ取り扱い条件、独自の監査証跡を持っています。 ヘルスケア 保険 金融サービスの調達チームは、その理由だけでバンドルを選ぶのが通常です。

1つのベンダー承認は、4つよりも速く進みます。

バンドルは本番でどう機能するか

3つのデプロイがトレードオフを具体的にします。

Anker: 音声自動化を、北米、欧州、アジアにまたがり年間数百万件の通話を処理するグローバルサポートセンター全体に展開。エージェントは英語圏市場で 95%超の音声認識精度を達成し、4ベンダーのパイプラインではなくAnker既存のテレフォニーの上で稼働しています。

Medical Data Systems: プラットフォームを通じた債権回収業務。チームは 現在、インバウンド通話の100%をわずか30%の転送率で処理し、毎月およそ$280,000を回収しています。その30%の転送率はプラットフォームのデフォルトではなく、ビジネス上の判断です。

Matic Insurance: サポート、予約確認、受付を処理する営業時間外のオペレーターボット。第1四半期に、このボットは 約8,000件の通話を処理し、その応答率は人間主導のベースラインを上回りました。ボットはMatic既存のTwilioとの関係の上に乗っています。

3社すべてに共通するパターン:

  • プラットフォームがエージェントレイヤーを所有する
  • 顧客の既存システムがデータとワークフローを所有する
  • キャリアとの関係は別契約である

それが、実際の本番デプロイにおけるバンドル対自前持ち込みの境界線です。

よくある質問

音声AIプラットフォームを使うのにElevenLabsのサブスクリプションが必要ですか?

いいえ。音声は分単価に組み込まれています。例外はエンタープライズ向けの音声クローニングで、別途設定されます。

音声AIエージェントを動かすのにTwilioは必須ですか?

いいえ。ほとんどのプラットフォームは、直接トランキングを通じてTelnyx、Vonage、Avaya、およびあらゆるSIP対応キャリアをサポートし、加えて自社の組み込み番号も備えています。Twilioが話題を独占するのは、単にそれが最も一般的な既存キャリアだからにすぎません。

自前のLLMを持ち込めますか?

はい。カスタムLLMはWebSocket統合を通じてサポートされており、OpenAI Enterprise契約、Anthropic API、Gemini、セルフホストのモデルも含まれます。推論についてはモデルプロバイダーに、オーケストレーションについてはプラットフォームに支払います。

バンドル価格は、Twilio + OpenAI + ElevenLabs 上でのDIY構築と比べてどうですか?

実質的なすべて込みのコストは、ほぼ同じ範囲、すなわち1分あたり$0.13〜$0.31に収まります。分単位の経済性は決め手ではありません。決め手は、オーケストレーションレイヤーで節約できるエンジニアリング時間であり、それは通常数か月に及びます。

オーケストレーションレイヤーには何が含まれますか?

音声をチャンク単位でストリーミングすること、言語モデルとTTSの間の文境界バッファリング、ターンテイキングとバージイン、ライブ通話中のfunction calling、基盤となるAPIをまたいだリトライとフェイルオーバー、シミュレーションテスト、感情スコア付きのトランスクリプト、そして統合された可観測性ダッシュボードです。

音声AIプラットフォームをアウトバウンド発信に大規模に使えますか?

はい。バッチコールは、すべてのアカウントで20件の無料同時通話とともにアウトバウンドキャンペーンをサポートします。一般的なユースケースには、 AIテレマーケティング リード選別(リードクオリフィケーション)、債権回収のフォローアップ、予約リマインダーなどがあります。TCPAとSTIR/SHAKENのコンプライアンスはキャリアレベルで設定されます。

エージェントが通話を処理できないとき、何が起こりますか?

完全な会話コンテキストを備えたウォームトランスファー(事前取次)です。電話を引き継ぐ人間は、トランスクリプトとエージェントが収集した構造化データを確認できるため、発信者が同じことを繰り返す必要はありません。エスカレーションのしきい値(明確化の試みの失敗、機微なトピック、発信者からの明示的な要求)はエージェントごとに設定されます。

このプラットフォームは規制産業に適していますか?

はい。SOC 2 Type II、セルフサービスのBAAを備えたHIPAA、GDPR、そしてPIIの秘匿化(redaction)が含まれています。厳格なデータレジデンシー要件を持つチーム向けに、オンプレミスのデプロイも利用可能です。

サインアップからライブエージェントまでどれくらいかかりますか?

ほとんどのチームは1時間以内に動作するテスト通話を、1〜2週間以内に本番対応のエージェントを手にします。プラットフォームは 月間5,000万件超の通話を3,000社超のビジネスにわたって処理しているため、デプロイのパスはよく踏み固められています。

購入判断を1段落で

4つのリアルタイム要素(テレフォニー、文字起こし、言語モデル、音声合成)は急速にコモディティ化しています。誰でも購入できます。それらを、顧客に聞かせてもよいと思える電話通話に変えるオーケストレーションこそ、エンジニアリングが積み上がる部分であり、2026年に分単位のプラットフォーム料金を支払う価値がある理由です。

境界線がどこにあるかを最も速く体感する方法は、実際に通話をすることです。Retell AI のサインアップには$10分の利用クレジットが含まれており、自分の番号に対してテストエージェントをデプロイし、既存システムがどこで接続され、プラットフォームがどこをエンドツーエンドで処理するのかを見るのに十分です。

そこからの自然な次の一歩は、最も重要なワークフローが何であれ、それです。

  • インバウンドの受電削減のためのAIカスタマーサポート
  • 発信者がすでに嫌っている電話ツリーを置き換える AI IVR
  • CRMに眠っているリードに向けたアウトバウンドキャンペーン

retellai.com で$10分のクレジットを使って構築しましょう。

ROI計算ツール
通話の自動化によるROIを試算

AI搭載の音声エージェントに切り替えることで、あなたのビジネスがどれだけ節約できるかをご確認ください。

完了しました! 
送信内容がメールに届いています
エラーが発生しました。フォームの送信中に問題が起きました。
   1
   8
20
エラーが発生しました。フォームの送信中に問題が起きました。

ROI結果

2,000

Total Human Agent Cost

$5,000
/month

AI Agent Cost

$3,000
/month

Estimated Savings

$2,000
/month
ライブデモ
ライブデモを試す

Retell クリニックオフィスのデモ電話番号

ありがとうございます!送信が完了しました!
エラーが発生しました。フォームの送信中に問題が起きました。

Read Other Blogs

Revolutionize your call operation with Retell