Die meisten Sprach-KI-Plattformen bündeln vier Bausteine in einem Preis pro Minute: Speech-to-Text, das Sprachmodell, Text-to-Speech und die Orchestrierung, die sie zu einem Echtzeit-Telefonanruf zusammenfügt. Die Telefonie kommt über SIP herein, aber die Carrier-Minuten, die Systeme, mit denen Ihr Agent spricht, und die Gesprächslogik selbst gehören weiterhin Ihnen.
Das ist die ganze Antwort. Der Rest dieses Leitfadens richtet sich an Käufer, die bei derselben Bewertungsfrage immer wieder hängen bleiben: "Moment, brauchen wir separate Abonnements für Telefonie, TTS, STT und LLMs, oder ist das bereits Teil der Plattform?"
Wenn Sie schon einmal in einem Anbietergespräch saßen und eine Sprach-KI-Plattform direkt mit Twilio, ElevenLabs oder OpenAI verglichen und gefragt haben, welche günstiger ist, dann ist dieser Artikel die klarste Antwort, die Sie bekommen werden. Diese Anbieter stehen nicht in derselben Spalte. Jeder verkauft eine einzelne Schicht des Stacks. Eine Plattform wie Retell AI verkauft das orchestrierte Ganze.
Zu wissen, welche Schicht Ihr Geld kauft, beantwortet vier praktische Fragen:
Jeder Sprachagent, der ein Telefon abnimmt, durchläuft dieselbe Kette. Audio kommt herein. Es wird transkribiert. Ein Modell verarbeitet das Transkript. Die Antwort wird zurückgesprochen. All das läuft parallel im Stream.
| Schicht | Was sie tut | Gängige Anbieter |
|---|---|---|
| Telefonie | Leitet Audio zwischen Telefon und Server weiter | Twilio, Telnyx, Vonage, Avaya |
| Speech-to-Text (STT) | Wandelt Audio in Text um | Deepgram, AssemblyAI, Whisper |
| Sprachmodell (LLM) | Liest, verarbeitet, entscheidet, antwortet | GPT-5, GPT-4o, Claude 4.5, Gemini 3.0 |
| Text-to-Speech (TTS) | Wandelt Text in gesprochenes Audio um | ElevenLabs, Cartesia, OpenAI, MiniMax |
| Orchestrierung | Streamt, puffert, steuert Sprecherwechsel und Tool-Aufrufe | Die Sprach-KI-Plattform |
Die ersten vier sind Standardware. Jeder nutzt in etwa dieselben Anbieter. Die fünfte ist der Punkt, an dem Teams still und leise drei bis sechs Monate Entwicklungszeit verbrennen, wenn sie versuchen, sie selbst zu bauen.
Die versteckten Kosten von "wir bauen es uns selbst zusammen": Streaming-WebSockets. Pufferung an Satzgrenzen. Voice Activity Detection. Barge-in-Wiederherstellung. Function Calling mitten im Gespräch. Retry-Logik über vier APIs hinweg. SIP-Integration, die mit den Eigenheiten des 8-kHz-Codecs umgeht. Nichts davon ist von Haus aus dabei.
Nein. Nicht mit einer Plattform. Mit einer Sprach-KI-Plattform unterschreiben Sie eine Vereinbarung und erhalten eine Rechnung. Mit reiner Infrastruktur unterschreiben Sie vier.
In echten Bewertungen tauchen drei Kaufwege auf:
1. Gebündelte Plattform: Ein Vertrag, eine Rechnung, ein Dashboard. Sie wählen eine Stimme und ein LLM aus Dropdown-Menüs; die Plattform kümmert sich um Lizenzierung, API-Aufrufe und Abrechnung. Das wählen die meisten Teams für die ersten 90 Tage.
2. Reine Infrastruktur: Twilio + ein STT-Anbieter + eine LLM-API + ein TTS-Anbieter, zusammengeklebt mit Ihrem eigenen Orchestrierungscode. Maximale Kontrolle, vier Sätze von Zugangsdaten, drei bis sechs Monate Entwicklung, bevor Sie einen echten Anruf entgegennehmen.
3. Hybrides Bring-your-own: Die Plattform übernimmt Orchestrierung und Komponenten, aber Sie bringen Ihren eigenen SIP-Trunk, Ihr feinabgestimmtes Modell oder Ihre Voice-Keys mit. Hier landen die meisten Produktivbereitstellungen nach dem ersten Quartal.
Der beworbene Tarif einer Plattform deckt die Orchestrierung ab. Die Komponenten kommen obendrauf, und sie sind transparente Einzelposten, keine versteckten Gebühren.
So schlüsselt sich ein typischer Mid-Market-Anruf auf der Preise-Seite auf:
| Komponente | Typischer Tarif | Hinweise |
|---|---|---|
| Basis-Orchestrierung | ~$0,07/Min. | Fest |
| Stimme (Cartesia) | ~$0,05–$0,07/Min. | ElevenLabs/OpenAI liegen höher |
| LLM | $0,003–$0,08/Min. | Gemini Flash am günstigsten, GPT-5 am höchsten |
| Telefonie (integriert) | ~$0,015/Min. | Oder $0 mit Ihrem eigenen SIP-Trunk |
| All-in (typisch) | $0,13–$0,20/Min. | Mittelklasse-Stimme + kompetentes Modell |
Zwei Hinweise, bevor Sie das für die Finanzabteilung modellieren:
Ja, und ja. Es hängt davon ab, was Sie bereits haben.
Sie können eine Telefonnummer direkt im Dashboard kaufen und in unter einer Stunde mit der Anrufannahme beginnen. Sie können auch eine bestehende Twilio-, Telnyx-, Vonage- oder Avaya-Nummer über SIP-Trunking mitbringen und den weiterverkauften Carrier ganz umgehen. Beide Wege nutzen darunter dieselbe Orchestrierungsschicht.
Schnelle Entscheidungsregel:
Sie können später wechseln. Der Reimport einer Nummer dauert Minuten, keine Migrationspläne.
Nein. Die Stimme, die Sie aus einem Dropdown-Menü wählen, ist im Preis pro Minute enthalten.
Das bringt viele Bewertungsgespräche durcheinander, weil ElevenLabs zwei unterschiedliche Produkte verkauft:
Wenn Sie eine Sprach-KI-Plattform nutzen, bekommen Sie Nr. 2. Kein separater API-Key. Kein separates Abonnement. Keine separate Rechnung. Lizenzierung und Abrechnung laufen im Backend.
Dieselbe Logik gilt für Cartesia, OpenAI TTS, MiniMax und die eigenen Sprachmodelle der Plattform. Die einzige Ausnahme ist das Enterprise-Voice-Cloning, das für Teams, die eine markenspezifische Stimme benötigen, separat konfiguriert wird.
Nein. Die Inferenz ist gebündelt. Sie wählen das Modell aus einem Dropdown-Menü, und der Preis pro Minute passt sich an:
Kein OpenAI-API-Key auf Ihrer Seite. Kein Anthropic-Konto. Kein Google-Cloud-Projekt.
Wenn Sie Ihr eigenes Modell mitbringen möchten (feinabgestimmte Gewichtungen, einen bereits unterzeichneten OpenAI-Enterprise-Vertrag oder eine selbstgehostete Llama-Bereitstellung), unterstützt die Plattform ein benutzerdefiniertes LLM per WebSocket. Die Integrationsschritte finden Sie in der Dokumentation.
Wann wird Bring-your-own-Model zur richtigen Wahl?
Für alle anderen ist der gebündelte Weg schneller bereitzustellen und leichter zu tauschen, wenn ein neues Modell erscheint.
Hier ist der Teil, der Teams überrascht. Die Plattform übernimmt das Gespräch. Sie übernehmen das Geschäft, dem es dient.
| Sie bringen mit | Die Plattform übernimmt |
|---|---|
| Inhalte der Wissensdatenbank (Ihr Servicekatalog, Preise, Öffnungszeiten, Richtlinien) | RAG-Abruf und Auto-Sync |
| CRM und System of Record | Webhook-Aufrufe während des Gesprächs |
| Kalender- und Buchungssystem | Echtzeit-Verfügbarkeitsprüfungen und Terminerstellung |
| Gestaltung des Gesprächsablaufs | Das Drag-and-drop-Framework, um ihn zu erstellen |
| Eskalationsregeln und Routing | Die betreute Weiterleitung mit vollem Kontext |
Ein paar erwähnenswerte Hinweise:
Die Kostenlücke ist klein. Die Zeitlücke ist enorm.
| Gebündelte Plattform | Bring-your-own-Aufbau | |
|---|---|---|
| Anbieterbeziehungen | 1 | 4+ |
| Zeit bis zum ersten Live-Anruf | Unter einer Stunde | 3–6 Monate |
| Vollkosten pro Minute | $0,13–$0,20 | $0,13–$0,31 |
| Erforderlicher Entwicklungsaufwand | Prompt + Ablaufgestaltung | Streaming-Pipeline + Retry-Logik + Observability + SIP-Handling |
| Compliance-Kette | Ein einziges BAA | Eines pro Anbieter im Stack |
Ein typischer Bring-your-own-Aufbau zieht Twilio für die Telefonie heran, Deepgram oder AssemblyAI für die Transkription, GPT-5 oder Claude 4.5 für die Verarbeitung, ElevenLabs oder Cartesia für die Stimme und Pipecat oder LiveKit für die Orchestrierung. Die Rechnung pro Minute landet in etwa in derselben Größenordnung wie bei einer gebündelten Plattform.
Wofür Sie beim Selbstbauen zahlen, ist Entwicklungszeit. Voice Activity Detection, Barge-in-Handling, Function Calling, das Ausfälle mitten im Gespräch übersteht, Observability, die vier Anbieter-Dashboards zu einem Trace korreliert, und SIP-Integration, die die Eigenheiten des 8-kHz-Codecs von Telefonie-Audio elegant handhabt. Nichts davon ist von Haus aus dabei.
Die meisten modernen Transkriptionsmodelle werden hauptsächlich mit 16-kHz-Audio trainiert. Die Telefonie liefert Ihnen 8 kHz. Die Genauigkeitslücke bei einer frisch gebauten Pipeline ist real und für Anrufer spürbar.
Diese Lücke zwischen Monaten an Verkabelung und Tagen an Prompt Engineering ist der Grund, warum die meisten produktiven Sprachagenten im Jahr 2026 auf einer Plattform starten.
Twilio, ElevenLabs, OpenAI und Retell AI konkurrieren nicht um denselben Dollar. Sie sind gestapelte Schichten in derselben Architektur:
Die richtige Betrachtung ist selten "Retell oder Twilio." Sie lautet "Retell auf Twilio." Genauso bei OpenAI und ElevenLabs. Die einzige echte Überschneidung sitzt auf der Orchestrierungsschicht, und die Retell vs. ElevenLabs-Seite behandelt diesen engeren Vergleich für Teams, die zwischen einer Plattform und dem eigenen durchgängigen Produkt von ElevenLabs wählen.
Compliance liegt auf der Plattformschicht. SOC 2 Type II, HIPAA mit einem Self-Service-BAA und DSGVO sind ohne Compliance-Aufschläge pro Minute enthalten.
Am wichtigsten ist das beim entbündelten Aufbau. In einem zusammengeklebten Stack hört Compliance nicht bei der Orchestrierung auf. Jeder Anbieter in der Kette (STT, LLM, TTS, Telefonie) hat seinen eigenen BAA-Prozess, seine eigenen Datenverarbeitungsbedingungen und seinen eigenen Audit-Trail. Beschaffungsteams im Gesundheitswesen, in der Versicherung und bei Finanzdienstleistungen wählen allein aus diesem Grund meist das Bündel.
Eine Anbieterfreigabe geht schneller als vier.
Drei Bereitstellungen machen den Kompromiss konkret:
Anker: Sprachautomatisierung über globale Support-Center hinweg, die jährlich Millionen von Anrufen in Nordamerika, Europa und Asien bearbeiten. Die Agenten erreichen über 95 % Spracherkennungsgenauigkeit in englischsprachigen Märkten und laufen auf der bestehenden Telefonie von Anker statt auf einer Vier-Anbieter-Pipeline.
Medical Data Systems: Inkasso-Betrieb über die Plattform. Das Team bearbeitet nun 100 % der eingehenden Anrufe bei nur 30 % Weiterleitungsrate und zieht rund $280.000 pro Monat ein. Diese Weiterleitungsrate von 30 % ist eine Geschäftsentscheidung, keine Standardeinstellung der Plattform.
Matic Insurance: After-Hours-Operator-Bot, der Support, Terminbestätigung und Erstaufnahme übernimmt. Im ersten Quartal bearbeitete der Bot rund 8.000 Anrufe, mit Beantwortungsraten, die die von Menschen geführte Basislinie übertrafen. Der Bot sitzt auf der bestehenden Twilio-Beziehung von Matic.
Das Muster über alle drei hinweg:
Das ist die Grenze zwischen Bündeln und Bring-your-own in echten Produktivbereitstellungen.
Brauche ich ein ElevenLabs-Abonnement, um eine Sprach-KI-Plattform zu nutzen?
Nein. Stimmen sind im Preis pro Minute eingebettet. Die Ausnahme ist das Enterprise-Voice-Cloning, das separat konfiguriert wird.
Ist Twilio erforderlich, um einen Sprach-KI-Agenten zu betreiben?
Nein. Die meisten Plattformen unterstützen Telnyx, Vonage, Avaya und jeden SIP-kompatiblen Carrier über direktes Trunking, plus ihre eigenen integrierten Nummern. Twilio dominiert das Gespräch nur, weil es der am häufigsten vorhandene Carrier ist.
Kann ich mein eigenes LLM mitbringen?
Ja. Benutzerdefinierte LLMs werden über eine WebSocket-Integration unterstützt, einschließlich OpenAI-Enterprise-Verträgen, der Anthropic-API, Gemini und selbstgehosteten Modellen. Sie zahlen Ihren Modellanbieter für die Inferenz und die Plattform für die Orchestrierung.
Wie verhält sich der gebündelte Preis zu einem DIY-Aufbau auf Twilio + OpenAI + ElevenLabs?
Die Vollkosten liegen in etwa im selben Bereich: zwischen $0,13 und $0,31 pro Minute. Die Ökonomie pro Minute ist nicht der entscheidende Faktor. Der entscheidende Faktor ist die eingesparte Entwicklungszeit auf der Orchestrierungsschicht, die typischerweise Monate beträgt.
Was umfasst die Orchestrierungsschicht?
Streaming von Audio in Chunks, Pufferung an Satzgrenzen zwischen Sprachmodell und TTS, Sprecherwechsel und Barge-in, Function Calling während eines Live-Anrufs, Retry und Failover über die zugrunde liegenden APIs, Simulationstests, Transkripte mit Stimmungsbewertung und ein einheitliches Observability-Dashboard.
Kann ich eine Sprach-KI-Plattform für ausgehende Anrufe in großem Umfang nutzen?
Ja. Batch-Anruf unterstützt ausgehende Kampagnen mit 20 kostenlosen gleichzeitigen Anrufen bei jedem Konto. Gängige Anwendungsfälle sind KI-Telemarketing, Lead-Qualifizierung, Inkasso-Nachverfolgung und Terminerinnerungen. TCPA- und STIR/SHAKEN-Compliance werden auf Carrier-Ebene konfiguriert.
Was passiert, wenn der Agent einen Anruf nicht bewältigen kann?
Betreute Weiterleitung mit vollem Gesprächskontext. Der Mensch, der übernimmt, sieht das Transkript und die strukturierten Daten, die der Agent erfasst hat, sodass der Anrufer sich nicht wiederholen muss. Eskalationsschwellen (fehlgeschlagene Klärungsversuche, sensible Themen, ausdrückliche Anruferwünsche) werden pro Agent konfiguriert.
Ist die Plattform für regulierte Branchen geeignet?
Ja. SOC 2 Type II, HIPAA mit einem Self-Service-BAA, DSGVO und PII-Schwärzung sind enthalten. On-Premise-Bereitstellung ist für Teams mit strengen Anforderungen an die Datenresidenz verfügbar.
Wie lange dauert es von der Registrierung bis zu einem Live-Agenten?
Die meisten Teams haben innerhalb einer Stunde einen funktionierenden Testanruf und innerhalb von 1–2 Wochen einen produktionsreifen Agenten. Die Plattform verarbeitet über 50 Millionen Anrufe pro Monat bei mehr als 3.000 Unternehmen, sodass der Bereitstellungsweg gut erprobt ist.
Die vier Echtzeit-Bausteine (Telefonie, Transkription, Sprachmodell, Sprachsynthese) werden schnell zur Standardware. Jeder kann sie kaufen. Die Orchestrierung, die sie in einen Telefonanruf verwandelt, den Sie einen Kunden hören lassen würden, ist der Punkt, an dem sich der Entwicklungsaufwand summiert, und deshalb lohnt sich eine Plattformgebühr pro Minute im Jahr 2026.
Der schnellste Weg, um zu spüren, wo die Grenze verläuft, ist ein echter Anruf. Die Registrierung bei Retell AI umfasst $10 an Nutzungsguthaben, das ausreicht, um einen Testagenten gegen Ihre eigene Nummer bereitzustellen und zu beobachten, wo sich Ihre bestehenden Systeme einklinken und was die Plattform durchgängig übernimmt.
Von dort aus ist der natürliche nächste Schritt der Workflow, der am wichtigsten ist:
Bauen Sie mit den $10 an Guthaben auf retellai.com.
Sehen Sie, wie viel Ihr Unternehmen durch den Wechsel zu KI-gestützten Sprachagenten sparen könnte.
Total Human Agent Cost
AI Agent Cost
Estimated Savings
Eine Demo-Telefonnummer von Retell Clinic Office

Start building smarter conversations today.


.avif)
.avif)