Was ist in einer Sprach-KI-Plattform enthalten? Telefonie, TTS, STT, LLMs und was Sie noch mitbringen müssen

Was ist in einer Sprach-KI-Plattform enthalten? Telefonie, TTS, STT, LLMs und was Sie noch mitbringen müssen
ZURÜCK ZU DEN BLOGS
AUF DIESER SEITE
Nach oben

Die meisten Sprach-KI-Plattformen bündeln vier Bausteine in einem Preis pro Minute: Speech-to-Text, das Sprachmodell, Text-to-Speech und die Orchestrierung, die sie zu einem Echtzeit-Telefonanruf zusammenfügt. Die Telefonie kommt über SIP herein, aber die Carrier-Minuten, die Systeme, mit denen Ihr Agent spricht, und die Gesprächslogik selbst gehören weiterhin Ihnen.

Das ist die ganze Antwort. Der Rest dieses Leitfadens richtet sich an Käufer, die bei derselben Bewertungsfrage immer wieder hängen bleiben: "Moment, brauchen wir separate Abonnements für Telefonie, TTS, STT und LLMs, oder ist das bereits Teil der Plattform?"

Wenn Sie schon einmal in einem Anbietergespräch saßen und eine Sprach-KI-Plattform direkt mit Twilio, ElevenLabs oder OpenAI verglichen und gefragt haben, welche günstiger ist, dann ist dieser Artikel die klarste Antwort, die Sie bekommen werden. Diese Anbieter stehen nicht in derselben Spalte. Jeder verkauft eine einzelne Schicht des Stacks. Eine Plattform wie Retell AI verkauft das orchestrierte Ganze.

Zu wissen, welche Schicht Ihr Geld kauft, beantwortet vier praktische Fragen:

  • Welche Verträge Sie unterschreiben
  • Welche Rechnungen Sie jeden Monat erhalten
  • Welche Entwicklungsstunden Sie vor dem Live-Gang aufwenden
  • Welche Teile des Stacks Sie austauschen können, wenn sich Preise oder Modelle ändern

Der Sprach-KI-Stack auf einen Blick

Jeder Sprachagent, der ein Telefon abnimmt, durchläuft dieselbe Kette. Audio kommt herein. Es wird transkribiert. Ein Modell verarbeitet das Transkript. Die Antwort wird zurückgesprochen. All das läuft parallel im Stream.

SchichtWas sie tutGängige Anbieter
TelefonieLeitet Audio zwischen Telefon und Server weiterTwilio, Telnyx, Vonage, Avaya
Speech-to-Text (STT)Wandelt Audio in Text umDeepgram, AssemblyAI, Whisper
Sprachmodell (LLM)Liest, verarbeitet, entscheidet, antwortetGPT-5, GPT-4o, Claude 4.5, Gemini 3.0
Text-to-Speech (TTS)Wandelt Text in gesprochenes Audio umElevenLabs, Cartesia, OpenAI, MiniMax
OrchestrierungStreamt, puffert, steuert Sprecherwechsel und Tool-AufrufeDie Sprach-KI-Plattform

Die ersten vier sind Standardware. Jeder nutzt in etwa dieselben Anbieter. Die fünfte ist der Punkt, an dem Teams still und leise drei bis sechs Monate Entwicklungszeit verbrennen, wenn sie versuchen, sie selbst zu bauen.

Die versteckten Kosten von "wir bauen es uns selbst zusammen": Streaming-WebSockets. Pufferung an Satzgrenzen. Voice Activity Detection. Barge-in-Wiederherstellung. Function Calling mitten im Gespräch. Retry-Logik über vier APIs hinweg. SIP-Integration, die mit den Eigenheiten des 8-kHz-Codecs umgeht. Nichts davon ist von Haus aus dabei.

Brauche ich separate Abonnements für Telefonie, TTS, STT und LLMs?

Nein. Nicht mit einer Plattform. Mit einer Sprach-KI-Plattform unterschreiben Sie eine Vereinbarung und erhalten eine Rechnung. Mit reiner Infrastruktur unterschreiben Sie vier.

In echten Bewertungen tauchen drei Kaufwege auf:

1. Gebündelte Plattform: Ein Vertrag, eine Rechnung, ein Dashboard. Sie wählen eine Stimme und ein LLM aus Dropdown-Menüs; die Plattform kümmert sich um Lizenzierung, API-Aufrufe und Abrechnung. Das wählen die meisten Teams für die ersten 90 Tage.

2. Reine Infrastruktur: Twilio + ein STT-Anbieter + eine LLM-API + ein TTS-Anbieter, zusammengeklebt mit Ihrem eigenen Orchestrierungscode. Maximale Kontrolle, vier Sätze von Zugangsdaten, drei bis sechs Monate Entwicklung, bevor Sie einen echten Anruf entgegennehmen.

3. Hybrides Bring-your-own: Die Plattform übernimmt Orchestrierung und Komponenten, aber Sie bringen Ihren eigenen SIP-Trunk, Ihr feinabgestimmtes Modell oder Ihre Voice-Keys mit. Hier landen die meisten Produktivbereitstellungen nach dem ersten Quartal.

Was ist im Preis pro Minute enthalten?

Der beworbene Tarif einer Plattform deckt die Orchestrierung ab. Die Komponenten kommen obendrauf, und sie sind transparente Einzelposten, keine versteckten Gebühren.

So schlüsselt sich ein typischer Mid-Market-Anruf auf der Preise-Seite auf:

KomponenteTypischer TarifHinweise
Basis-Orchestrierung~$0,07/Min.Fest
Stimme (Cartesia)~$0,05–$0,07/Min.ElevenLabs/OpenAI liegen höher
LLM$0,003–$0,08/Min.Gemini Flash am günstigsten, GPT-5 am höchsten
Telefonie (integriert)~$0,015/Min.Oder $0 mit Ihrem eigenen SIP-Trunk
All-in (typisch)$0,13–$0,20/Min.Mittelklasse-Stimme + kompetentes Modell

Zwei Hinweise, bevor Sie das für die Finanzabteilung modellieren:

  • Ein Einstiegspreis von $0,07 ist kein Produktionskostenpunkt von $0,07. Der beworbene Preis deckt nur die Orchestrierung ab.
  • Add-ons liegen außerhalb des Preises pro Minute: Streaming-Wissensdatenbank (kostenlos für die ersten zehn, danach ~$0,005/Min.), Nebenläufigkeit über 20 Anrufe hinaus, gebrandete Anrufer-ID. Keines davon ist für den Live-Gang erforderlich.

Ist die Telefonie gebündelt, oder brauche ich trotzdem Twilio?

Ja, und ja. Es hängt davon ab, was Sie bereits haben.

Sie können eine Telefonnummer direkt im Dashboard kaufen und in unter einer Stunde mit der Anrufannahme beginnen. Sie können auch eine bestehende Twilio-, Telnyx-, Vonage- oder Avaya-Nummer über SIP-Trunking mitbringen und den weiterverkauften Carrier ganz umgehen. Beide Wege nutzen darunter dieselbe Orchestrierungsschicht.

Schnelle Entscheidungsregel:

  • Fangen Sie bei null an? Nutzen Sie die integrierte Nummer. Schneller, günstiger, keine Carrier-Einrichtung.
  • Bestehender Carrier-Vertrag oder portierte Nummern? Bringen Sie Ihren eigenen SIP-Trunk mit. Behalten Sie Ihre Tarife, Ihre STIR/SHAKEN-Attestierung und Ihr DID-Portfolio.
  • Bereits tief in einerTwilio-Integration? Gleiche Antwort: Richten Sie den Trunk auf die Plattform aus und importieren Sie die Nummer.

Sie können später wechseln. Der Reimport einer Nummer dauert Minuten, keine Migrationspläne.

Muss ich ElevenLabs separat bezahlen?

Nein. Die Stimme, die Sie aus einem Dropdown-Menü wählen, ist im Preis pro Minute enthalten.

Das bringt viele Bewertungsgespräche durcheinander, weil ElevenLabs zwei unterschiedliche Produkte verkauft:

  • Sein eigenes durchgängiges Conversational-AI-Produkt (direkt verkauft, ~$0,10/Min. plus LLM-Kosten)
  • Seine Sprachmodelle, lizenziert an Plattformen, die sie einbetten und auf Minutenbasis weiterverkaufen

Wenn Sie eine Sprach-KI-Plattform nutzen, bekommen Sie Nr. 2. Kein separater API-Key. Kein separates Abonnement. Keine separate Rechnung. Lizenzierung und Abrechnung laufen im Backend.

Dieselbe Logik gilt für Cartesia, OpenAI TTS, MiniMax und die eigenen Sprachmodelle der Plattform. Die einzige Ausnahme ist das Enterprise-Voice-Cloning, das für Teams, die eine markenspezifische Stimme benötigen, separat konfiguriert wird.

Brauche ich ein OpenAI-Abonnement für das LLM?

Nein. Die Inferenz ist gebündelt. Sie wählen das Modell aus einem Dropdown-Menü, und der Preis pro Minute passt sich an:

  • Am günstigsten: Gemini 3.0 Flash, GPT-5 Nano (Bruchteile eines Cents)
  • Mittelklasse: GPT-4o, Claude Haiku
  • Verarbeitungsintensiv: Claude 4.5 Sonnet, GPT-5

Kein OpenAI-API-Key auf Ihrer Seite. Kein Anthropic-Konto. Kein Google-Cloud-Projekt.

Wenn Sie Ihr eigenes Modell mitbringen möchten (feinabgestimmte Gewichtungen, einen bereits unterzeichneten OpenAI-Enterprise-Vertrag oder eine selbstgehostete Llama-Bereitstellung), unterstützt die Plattform ein benutzerdefiniertes LLM per WebSocket. Die Integrationsschritte finden Sie in der Dokumentation.

Wann wird Bring-your-own-Model zur richtigen Wahl?

  • Strenge Anforderungen an die Datenresidenz
  • Bestehende LLM-Verpflichtungen, die Sie monetarisieren möchten
  • Domänenspezifisches Fine-Tuning, das für Ihren Anwendungsfall universelle Modelle deutlich übertrifft

Für alle anderen ist der gebündelte Weg schneller bereitzustellen und leichter zu tauschen, wenn ein neues Modell erscheint.

Was Sie noch mitbringen müssen

Hier ist der Teil, der Teams überrascht. Die Plattform übernimmt das Gespräch. Sie übernehmen das Geschäft, dem es dient.

Sie bringen mitDie Plattform übernimmt
Inhalte der Wissensdatenbank (Ihr Servicekatalog, Preise, Öffnungszeiten, Richtlinien)RAG-Abruf und Auto-Sync
CRM und System of RecordWebhook-Aufrufe während des Gesprächs
Kalender- und BuchungssystemEchtzeit-Verfügbarkeitsprüfungen und Terminerstellung
Gestaltung des GesprächsablaufsDas Drag-and-drop-Framework, um ihn zu erstellen
Eskalationsregeln und RoutingDie betreute Weiterleitung mit vollem Kontext

Ein paar erwähnenswerte Hinweise:

  • Die Wissensdatenbank synchronisiert sich automatisch von Ihrer Website oder Ihrem Dokumentensatz, aber der Inhalt dieser Dokumente muss von Ihnen aktuell gehalten werden. Müll rein, Müll raus, wie bei jedem RAG-System.
  • Die CRM-Integration läuft über Webhooks, Make, n8n, Zapier oder eine native HubSpot-Integration. Der Agent kann während eines Live-Anrufs aus Salesforce oder HubSpot lesen und schreiben, aber Schema und Berechtigungen liegen bei Ihnen.
  • Für Termine buchen-Abläufe läuft die Integration gegen Cal.com, Google Calendar, Calendly oder das Buchungssystem, das Ihren maßgeblichen Kalender führt.
  • Vorlagen gibt es für gängige Muster wie KI-Terminierungsagent, KI-Telefonservice, eingehenden Support, aber die tatsächlichen Fragen, die Ihr Agent stellt, und was als "qualifizierter Lead" gilt, sind Entscheidungen, die nur Sie treffen können.
  • Für Anrufweiterleitung-Eskalationen legen Sie den Schwellenwert fest. Produktivbereitstellungen automatisieren routinemäßig bis zu 80 Prozent der eingehenden Anrufe, aber wo Sie die Grenze zwischen KI und Mensch ziehen, entscheiden Sie.

Bündeln vs. bauen: der ehrliche Vergleich

Die Kostenlücke ist klein. Die Zeitlücke ist enorm.

Gebündelte PlattformBring-your-own-Aufbau
Anbieterbeziehungen14+
Zeit bis zum ersten Live-AnrufUnter einer Stunde3–6 Monate
Vollkosten pro Minute$0,13–$0,20$0,13–$0,31
Erforderlicher EntwicklungsaufwandPrompt + AblaufgestaltungStreaming-Pipeline + Retry-Logik + Observability + SIP-Handling
Compliance-KetteEin einziges BAAEines pro Anbieter im Stack

Ein typischer Bring-your-own-Aufbau zieht Twilio für die Telefonie heran, Deepgram oder AssemblyAI für die Transkription, GPT-5 oder Claude 4.5 für die Verarbeitung, ElevenLabs oder Cartesia für die Stimme und Pipecat oder LiveKit für die Orchestrierung. Die Rechnung pro Minute landet in etwa in derselben Größenordnung wie bei einer gebündelten Plattform.

Wofür Sie beim Selbstbauen zahlen, ist Entwicklungszeit. Voice Activity Detection, Barge-in-Handling, Function Calling, das Ausfälle mitten im Gespräch übersteht, Observability, die vier Anbieter-Dashboards zu einem Trace korreliert, und SIP-Integration, die die Eigenheiten des 8-kHz-Codecs von Telefonie-Audio elegant handhabt. Nichts davon ist von Haus aus dabei.

Die meisten modernen Transkriptionsmodelle werden hauptsächlich mit 16-kHz-Audio trainiert. Die Telefonie liefert Ihnen 8 kHz. Die Genauigkeitslücke bei einer frisch gebauten Pipeline ist real und für Anrufer spürbar.

Diese Lücke zwischen Monaten an Verkabelung und Tagen an Prompt Engineering ist der Grund, warum die meisten produktiven Sprachagenten im Jahr 2026 auf einer Plattform starten.

Wo die Grenzen verlaufen

Twilio, ElevenLabs, OpenAI und Retell AI konkurrieren nicht um denselben Dollar. Sie sind gestapelte Schichten in derselben Architektur:

  • Twilio, Telnyx, Vonage → Telefonie. Audio zwischen Telefonen und Servern bewegen.
  • ElevenLabs, Cartesia, OpenAI TTS, MiniMax → Sprachsynthese. Text in Sprache umwandeln.
  • OpenAI, Anthropic, Google → Sprachmodell-Inferenz. Das denkende Gehirn.
  • Retell AI → Orchestrierung plus das Agenten-Framework, Post-Call-Analyse, Batch-Anruf, Simulationstests und die kommerzielle Klammer, die aus vier Rechnungen eine macht.

Die richtige Betrachtung ist selten "Retell oder Twilio." Sie lautet "Retell auf Twilio." Genauso bei OpenAI und ElevenLabs. Die einzige echte Überschneidung sitzt auf der Orchestrierungsschicht, und die Retell vs. ElevenLabs-Seite behandelt diesen engeren Vergleich für Teams, die zwischen einer Plattform und dem eigenen durchgängigen Produkt von ElevenLabs wählen.

Was ist mit HIPAA, SOC 2 und DSGVO?

Compliance liegt auf der Plattformschicht. SOC 2 Type II, HIPAA mit einem Self-Service-BAA und DSGVO sind ohne Compliance-Aufschläge pro Minute enthalten.

Am wichtigsten ist das beim entbündelten Aufbau. In einem zusammengeklebten Stack hört Compliance nicht bei der Orchestrierung auf. Jeder Anbieter in der Kette (STT, LLM, TTS, Telefonie) hat seinen eigenen BAA-Prozess, seine eigenen Datenverarbeitungsbedingungen und seinen eigenen Audit-Trail. Beschaffungsteams im Gesundheitswesen, in der Versicherung und bei Finanzdienstleistungen wählen allein aus diesem Grund meist das Bündel.

Eine Anbieterfreigabe geht schneller als vier.

Wie sich das Bündel in der Produktion bewährt

Drei Bereitstellungen machen den Kompromiss konkret:

Anker: Sprachautomatisierung über globale Support-Center hinweg, die jährlich Millionen von Anrufen in Nordamerika, Europa und Asien bearbeiten. Die Agenten erreichen über 95 % Spracherkennungsgenauigkeit in englischsprachigen Märkten und laufen auf der bestehenden Telefonie von Anker statt auf einer Vier-Anbieter-Pipeline.

Medical Data Systems: Inkasso-Betrieb über die Plattform. Das Team bearbeitet nun 100 % der eingehenden Anrufe bei nur 30 % Weiterleitungsrate und zieht rund $280.000 pro Monat ein. Diese Weiterleitungsrate von 30 % ist eine Geschäftsentscheidung, keine Standardeinstellung der Plattform.

Matic Insurance: After-Hours-Operator-Bot, der Support, Terminbestätigung und Erstaufnahme übernimmt. Im ersten Quartal bearbeitete der Bot rund 8.000 Anrufe, mit Beantwortungsraten, die die von Menschen geführte Basislinie übertrafen. Der Bot sitzt auf der bestehenden Twilio-Beziehung von Matic.

Das Muster über alle drei hinweg:

  • Die Plattform besitzt die Agentenschicht
  • Die bestehenden Systeme des Kunden besitzen die Daten und Workflows
  • Die Carrier-Beziehung ist ein separater Vertrag

Das ist die Grenze zwischen Bündeln und Bring-your-own in echten Produktivbereitstellungen.

Häufig gestellte Fragen

Brauche ich ein ElevenLabs-Abonnement, um eine Sprach-KI-Plattform zu nutzen?

Nein. Stimmen sind im Preis pro Minute eingebettet. Die Ausnahme ist das Enterprise-Voice-Cloning, das separat konfiguriert wird.

Ist Twilio erforderlich, um einen Sprach-KI-Agenten zu betreiben?

Nein. Die meisten Plattformen unterstützen Telnyx, Vonage, Avaya und jeden SIP-kompatiblen Carrier über direktes Trunking, plus ihre eigenen integrierten Nummern. Twilio dominiert das Gespräch nur, weil es der am häufigsten vorhandene Carrier ist.

Kann ich mein eigenes LLM mitbringen?

Ja. Benutzerdefinierte LLMs werden über eine WebSocket-Integration unterstützt, einschließlich OpenAI-Enterprise-Verträgen, der Anthropic-API, Gemini und selbstgehosteten Modellen. Sie zahlen Ihren Modellanbieter für die Inferenz und die Plattform für die Orchestrierung.

Wie verhält sich der gebündelte Preis zu einem DIY-Aufbau auf Twilio + OpenAI + ElevenLabs?

Die Vollkosten liegen in etwa im selben Bereich: zwischen $0,13 und $0,31 pro Minute. Die Ökonomie pro Minute ist nicht der entscheidende Faktor. Der entscheidende Faktor ist die eingesparte Entwicklungszeit auf der Orchestrierungsschicht, die typischerweise Monate beträgt.

Was umfasst die Orchestrierungsschicht?

Streaming von Audio in Chunks, Pufferung an Satzgrenzen zwischen Sprachmodell und TTS, Sprecherwechsel und Barge-in, Function Calling während eines Live-Anrufs, Retry und Failover über die zugrunde liegenden APIs, Simulationstests, Transkripte mit Stimmungsbewertung und ein einheitliches Observability-Dashboard.

Kann ich eine Sprach-KI-Plattform für ausgehende Anrufe in großem Umfang nutzen?

Ja. Batch-Anruf unterstützt ausgehende Kampagnen mit 20 kostenlosen gleichzeitigen Anrufen bei jedem Konto. Gängige Anwendungsfälle sind KI-Telemarketing, Lead-Qualifizierung, Inkasso-Nachverfolgung und Terminerinnerungen. TCPA- und STIR/SHAKEN-Compliance werden auf Carrier-Ebene konfiguriert.

Was passiert, wenn der Agent einen Anruf nicht bewältigen kann?

Betreute Weiterleitung mit vollem Gesprächskontext. Der Mensch, der übernimmt, sieht das Transkript und die strukturierten Daten, die der Agent erfasst hat, sodass der Anrufer sich nicht wiederholen muss. Eskalationsschwellen (fehlgeschlagene Klärungsversuche, sensible Themen, ausdrückliche Anruferwünsche) werden pro Agent konfiguriert.

Ist die Plattform für regulierte Branchen geeignet?

Ja. SOC 2 Type II, HIPAA mit einem Self-Service-BAA, DSGVO und PII-Schwärzung sind enthalten. On-Premise-Bereitstellung ist für Teams mit strengen Anforderungen an die Datenresidenz verfügbar.

Wie lange dauert es von der Registrierung bis zu einem Live-Agenten?

Die meisten Teams haben innerhalb einer Stunde einen funktionierenden Testanruf und innerhalb von 1–2 Wochen einen produktionsreifen Agenten. Die Plattform verarbeitet über 50 Millionen Anrufe pro Monat bei mehr als 3.000 Unternehmen, sodass der Bereitstellungsweg gut erprobt ist.

Die Kaufentscheidung in einem Absatz

Die vier Echtzeit-Bausteine (Telefonie, Transkription, Sprachmodell, Sprachsynthese) werden schnell zur Standardware. Jeder kann sie kaufen. Die Orchestrierung, die sie in einen Telefonanruf verwandelt, den Sie einen Kunden hören lassen würden, ist der Punkt, an dem sich der Entwicklungsaufwand summiert, und deshalb lohnt sich eine Plattformgebühr pro Minute im Jahr 2026.

Der schnellste Weg, um zu spüren, wo die Grenze verläuft, ist ein echter Anruf. Die Registrierung bei Retell AI umfasst $10 an Nutzungsguthaben, das ausreicht, um einen Testagenten gegen Ihre eigene Nummer bereitzustellen und zu beobachten, wo sich Ihre bestehenden Systeme einklinken und was die Plattform durchgängig übernimmt.

Von dort aus ist der natürliche nächste Schritt der Workflow, der am wichtigsten ist:

  • KI-Kundensupport für die Abwehr eingehender Anrufe
  • Ein KI-IVR-Ersatz für das Telefonmenü, das Ihre Anrufer bereits hassen
  • Eine ausgehende Kampagne für die Leads, die in Ihrem CRM liegen

Bauen Sie mit den $10 an Guthaben auf retellai.com.

ROI-Rechner
Schätzen Sie Ihren ROI durch die Automatisierung von Anrufen

Sehen Sie, wie viel Ihr Unternehmen durch den Wechsel zu KI-gestützten Sprachagenten sparen könnte.

Fertig! 
Ihre Anfrage wurde an Ihre E-Mail-Adresse gesendet
Hoppla! Beim Absenden des Formulars ist ein Fehler aufgetreten.
   1
   8
20
Hoppla! Beim Absenden des Formulars ist ein Fehler aufgetreten.

ROI-Ergebnis

2,000

Total Human Agent Cost

$5,000
/month

AI Agent Cost

$3,000
/month

Estimated Savings

$2,000
/month
Live-Demo
Unsere Live-Demo ausprobieren

Eine Demo-Telefonnummer von Retell Clinic Office

Vielen Dank! Ihre Anfrage wurde erfolgreich übermittelt!
Ups! Beim Absenden des Formulars ist ein Fehler aufgetreten.

Read Other Blogs

Revolutionize your call operation with Retell