Wat zit er in een voice-AI-platform gebundeld? Telefonie, TTS, STT, LLM's en wat je nog zelf moet meenemen

Wat zit er in een voice-AI-platform gebundeld? Telefonie, TTS, STT, LLM's en wat je nog zelf moet meenemen
BACK TO BLOGS
ON THIS PAGE
Back to top

De meeste voice-AI-platforms bundelen vier onderdelen in één prijs per minuut: speech-to-text, het taalmodel, text-to-speech en de orkestratie die ze samenbrengt tot een realtime telefoongesprek. Telefonie komt binnen via SIP, maar de carrierminuten, de systemen waarmee je agent praat en de gesprekslogica zelf blijven van jou.

Dat is het hele antwoord. De rest van deze gids is voor kopers die telkens vastlopen op dezelfde evaluatievraag: "Wacht, hebben we aparte abonnementen nodig voor telefonie, TTS, STT en LLM's, of zit dit al in het platform?"

Als je in een gesprek met een leverancier hebt gezeten waarin een voice-AI-platform naast Twilio, ElevenLabs of OpenAI werd gelegd en je je afvroeg wat goedkoper is, dan is dit artikel het helderste antwoord dat je krijgt. Die leveranciers zitten niet in dezelfde kolom. Elk verkoopt één laag van de stack. Een platform als Retell AI verkoopt het georkestreerde geheel.

Weten welke laag je geld koopt, beantwoordt vier praktische vragen:

  • Welke contracten je ondertekent
  • Welke facturen je elke maand ontvangt
  • Welke engineeringuren je besteedt voordat je live gaat
  • Welke onderdelen van de stack je kunt vervangen wanneer prijzen of modellen veranderen

De voice-AI-stack in één oogopslag

Elke voice-agent die de telefoon opneemt, draait dezelfde keten. Audio komt binnen. Die wordt getranscribeerd. Een model redeneert over het transcript. Het antwoord wordt uitgesproken. Alles streamt parallel.

LaagWat het doetVeelvoorkomende providers
TelefonieRouteert audio tussen telefoon en serverTwilio, Telnyx, Vonage, Avaya
Speech-to-text (STT)Zet audio om in tekstDeepgram, AssemblyAI, Whisper
Taalmodel (LLM)Leest, redeneert, beslist, antwoordtGPT-5, GPT-4o, Claude 4.5, Gemini 3.0
Text-to-speech (TTS)Zet tekst om in gesproken audioElevenLabs, Cartesia, OpenAI, MiniMax
OrkestratieStreamt, buffert, regelt beurtwisseling en tool-callsHet voice-AI-platform

De eerste vier zijn commodity's. Iedereen gebruikt grofweg dezelfde providers. De vijfde is waar teams stilletjes drie tot zes maanden engineering verbranden wanneer ze het zelf proberen te bouwen.

De verborgen kosten van "we knopen het zelf wel aan elkaar": Streaming WebSockets. Buffering op zinsgrenzen. Detectie van spraakactiviteit. Herstel na barge-in. Function calling midden in het gesprek. Retry-logica over vier API's. SIP-integratie die de eigenaardigheden van de 8 kHz-codec afhandelt. Niets daarvan werkt kant-en-klaar.

Heb ik aparte abonnementen nodig voor telefonie, TTS, STT en LLM's?

Nee. Niet met een platform. Met een voice-AI-platform onderteken je één overeenkomst en krijg je één factuur. Met kale infrastructuur onderteken je er vier.

In echte evaluaties duiken drie aankooproutes op:

1. Gebundeld platform: Eén contract, één factuur, één dashboard. Je kiest een stem en een LLM uit dropdowns; het platform regelt de licentie, API-calls en metering. Dit is wat de meeste teams de eerste 90 dagen kiezen.

2. Kale infrastructuur: Twilio + een STT-provider + een LLM-API + een TTS-provider, aan elkaar geplakt met je eigen orkestratiecode. Maximale controle, vier sets aan credentials, drie tot zes maanden engineering voordat je een echt gesprek voert.

3. Hybride bring-your-own: Het platform regelt orkestratie en componenten, maar je brengt je eigen SIP-trunk, fine-tuned model of stemkeys mee. Hier komen de meeste productie-implementaties na het eerste kwartaal terecht.

Wat zit er in de prijs per minuut?

Het toptarief van een platform dekt de orkestratie. De componenten liggen daar bovenop, en het zijn transparante posten, geen verborgen kosten.

Zo valt een typisch mid-marketgesprek uiteen op de prijzen-pagina:

ComponentTypisch tariefOpmerkingen
Basis-orkestratie~$0,07/minVast
Stem (Cartesia)~$0,05–$0,07/minElevenLabs/OpenAI liggen hoger
LLM$0,003–$0,08/minGemini Flash goedkoopst, GPT-5 hoogst
Telefonie (ingebouwd)~$0,015/minOf $0 met je eigen SIP-trunk
Alles inbegrepen (typisch)$0,13–$0,20/minMid-tier stem + competent model

Twee opmerkingen voordat je dit voor finance modelleert:

  • Een instappunt van $0,07 is geen productiekost van $0,07. Het toptarief dekt alleen de orkestratie.
  • Add-ons vallen buiten de prijs per minuut: streaming kennisbank (gratis voor de eerste tien, daarna ~$0,005/min), gelijktijdigheid boven de 20 gesprekken, gebrande beller-ID. Geen daarvan is nodig om live te gaan.

Is telefonie gebundeld, of heb ik nog steeds Twilio nodig?

Ja, en ja. Het hangt af van wat je al hebt.

Je kunt rechtstreeks in het dashboard een telefoonnummer kopen en binnen een uur gesprekken beginnen aan te nemen. Je kunt ook een bestaand Twilio-, Telnyx-, Vonage- of Avaya-nummer via SIP-trunking meenemen en de doorverkochte carrier volledig overslaan. Beide routes gebruiken onderliggend dezelfde orkestratielaag.

Snelle beslisregel:

  • Begin je vanaf nul? Gebruik het ingebouwde nummer. Sneller, goedkoper, geen carrier-setup.
  • Bestaand carriercontract of geporteerde nummers? Breng je eigen SIP-trunk mee. Behoud je tarieven, je STIR/SHAKEN-attestatie en je DID-portfolio.
  • Zit je al diep in eenTwilio-integratie? Zelfde antwoord: richt de trunk op het platform en importeer het nummer.

Je kunt later overstappen. Een nummer opnieuw importeren kost minuten, geen migratieplannen.

Moet ik ElevenLabs apart betalen?

Nee. De stem die je uit een dropdown kiest, zit in de prijs per minuut.

Dit brengt veel evaluatiegesprekken in de war, omdat ElevenLabs twee verschillende producten verkoopt:

  • Zijn eigen end-to-end Conversational AI-product (rechtstreeks verkocht, ~$0,10/min plus LLM-kosten)
  • Zijn stemmodellen, in licentie gegeven aan platforms die ze inbedden en per minuut doorverkopen

Als je een voice-AI-platform gebruikt, krijg je #2. Geen aparte API-key. Geen apart abonnement. Geen aparte factuur. De licentie en metering gebeuren op de backend.

Dezelfde logica geldt voor Cartesia, OpenAI TTS, MiniMax en de eigen stemmodellen van het platform. De enige uitzondering is enterprise stemklonen, die apart wordt geconfigureerd voor teams die een merkspecifieke stem nodig hebben.

Heb ik een OpenAI-abonnement nodig voor de LLM?

Nee. Inferentie is gebundeld. Je kiest het model uit een dropdown en de prijs per minuut past zich aan:

  • Goedkoopst: Gemini 3.0 Flash, GPT-5 Nano (fracties van een cent)
  • Mid-tier: GPT-4o, Claude Haiku
  • Redeneer-intensief: Claude 4.5 Sonnet, GPT-5

Geen OpenAI-API-key aan jouw kant. Geen Anthropic-account. Geen Google Cloud-project.

Als je je eigen model wilt meenemen (fine-tuned weights, een OpenAI Enterprise-contract dat je al hebt ondertekend, of een self-hosted Llama-implementatie), ondersteunt het platform een custom LLM WebSocket. De integratiestappen staan in de documentatie.

Wanneer wordt bring-your-own-model de juiste keuze?

  • Strikte eisen voor dataresidentie
  • Bestaande LLM-verplichtingen die je wilt te gelde maken
  • Domeinspecifieke fine-tuning die voor jouw use case aanzienlijk beter presteert dan generieke modellen

Voor iedereen anders is de gebundelde route sneller uit te rollen en makkelijker te wisselen wanneer een nieuw model verschijnt.

Wat je nog zelf moet meenemen

Hier komt het deel dat teams verrast. Het platform regelt het gesprek. Jij regelt het bedrijf dat het bedient.

Jij brengt meeHet platform regelt
Kennisbankinhoud (je servicecatalogus, prijzen, openingstijden, beleid)RAG-retrieval en auto-sync
CRM en system of recordWebhook-calls tijdens het gesprek
Agenda- en boekingssysteemRealtime beschikbaarheidscontroles en het aanmaken van afspraken
Ontwerp van de gespreksflowHet drag-and-drop-framework om het in te bouwen
Escalatieregels en routeringDe warme doorverbinding met volledige context

Een paar opmerkingen die het waard zijn om te noemen:

  • De kennisbank synchroniseert automatisch vanaf je website of documentenset, maar de inhoud van die documenten moet jij zelf up-to-date houden. Garbage in, garbage out, net als bij elk RAG-systeem.
  • CRM-integratie loopt via webhooks, Make, n8n, Zapier of een native HubSpot-integratie. De agent kan tijdens een live gesprek lezen van en schrijven naar Salesforce of HubSpot, maar het schema en de rechten liggen bij jou.
  • Voor afspraken inplannen-flows draait de integratie tegen Cal.com, Google Calendar, Calendly of welk boekingssysteem je agenda van record ook bevat.
  • Er bestaan templates voor veelvoorkomende patronen zoals AI-afsprakenplanner, AI-antwoordservice, inbound support, maar de daadwerkelijke vragen die je agent stelt en wat als een "gekwalificeerde lead" telt, zijn beslissingen die alleen jij kunt nemen.
  • Voor gespreksoverdracht-escalaties bepaal je de drempel. Productie-implementaties automatiseren routinematig tot 80 procent van de inkomende gesprekken, maar waar je de grens tussen AI en mens trekt, is jouw keuze.

Bundelen versus bouwen: de eerlijke vergelijking

Het kostenverschil is klein. Het tijdsverschil is enorm.

Gebundeld platformBring-your-own-build
Leveranciersrelaties14+
Tijd tot eerste live gesprekMinder dan een uur3–6 maanden
Volledige kost per minuut$0,13–$0,20$0,13–$0,31
Vereiste engineeringPrompt + flow-ontwerpStreaming-pipeline + retry-logica + observability + SIP-afhandeling
Compliance-ketenEΓ©n BAAEΓ©n per leverancier in de stack

Een typische bring-your-own-build haalt Twilio voor telefonie, Deepgram of AssemblyAI voor transcriptie, GPT-5 of Claude 4.5 voor redenering, ElevenLabs of Cartesia voor stem, en Pipecat of LiveKit voor orkestratie. Het rekensommetje per minuut belandt grofweg in dezelfde buurt als een gebundeld platform.

Waar je voor betaalt wanneer je bouwt, is engineeringtijd. Detectie van spraakactiviteit, barge-in-afhandeling, function calling die storingen midden in het gesprek overleeft, observability die vier leveranciersdashboards tot één trace correleert, en SIP-integratie die de eigenaardigheden van de 8 kHz-codec van telefonie-audio soepel afhandelt. Niets daarvan werkt kant-en-klaar.

De meeste moderne transcriptiemodellen zijn primair getraind op 16 kHz-audio. Telefonie geeft je 8 kHz. Het nauwkeurigheidsverschil op een vers gebouwde pipeline is echt en merkbaar voor bellers.

Dat verschil tussen maanden aan leidingwerk en dagen aan prompt engineering is de reden waarom de meeste productie-voice-agents in 2026 op een platform draaien.

Waar de grenzen liggen

Twilio, ElevenLabs, OpenAI en Retell AI concurreren niet om dezelfde dollar. Het zijn gestapelde lagen in dezelfde architectuur:

  • Twilio, Telnyx, Vonage β†’ telefonie. Verplaatsen audio tussen telefoons en servers.
  • ElevenLabs, Cartesia, OpenAI TTS, MiniMax β†’ stemsynthese. Zetten tekst om in spraak.
  • OpenAI, Anthropic, Google β†’ taalmodel-inferentie. Het redenerende brein.
  • Retell AI β†’ orkestratie plus het agent-framework, analyse na het gesprek, batchgesprekken, simulatietests, en de commerciΓ«le wrapper die vier facturen in één verandert.

De juiste framing is zelden "Retell of Twilio". Het is "Retell bovenop Twilio". Hetzelfde geldt voor OpenAI en ElevenLabs. De enige echte overlap zit op de orkestratielaag, en de Retell vs ElevenLabs-pagina behandelt die smallere vergelijking voor teams die kiezen tussen een platform en het eigen end-to-end-product van ElevenLabs.

Hoe zit het met HIPAA, SOC 2 en GDPR?

Compliance zit op de platformlaag. SOC 2 Type II, HIPAA met een selfservice-BAA, en GDPR zijn inbegrepen zonder compliance-toeslagen per minuut.

Waar dit het meest telt, is de ontbundelde build. Compliance stopt niet bij de orkestratie in een aan elkaar geplakte stack. Elke leverancier in de keten (STT, LLM, TTS, telefonie) heeft zijn eigen BAA-proces, zijn eigen voorwaarden voor gegevensverwerking en zijn eigen audit trail. Inkoopteams in de gezondheidszorg, verzekeringen en financiΓ«le dienstverlening kiezen meestal alleen daarom al voor de bundel.

EΓ©n leveranciersgoedkeuring gaat sneller dan vier.

Hoe de bundel presteert in productie

Drie implementaties maken de afweging concreet:

Anker: Voice-automatisering over wereldwijde supportcenters die miljoenen gesprekken per jaar afhandelen in Noord-Amerika, Europa en AziΓ«. De agents halen 95%+ spraakherkenningsnauwkeurigheid in Engelstalige markten, en draaien bovenop de bestaande telefonie van Anker in plaats van op een pipeline met vier leveranciers.

Medical Data Systems: Incasso-operaties via het platform. Het team handelt nu 100% van de inkomende gesprekken af met slechts een transferpercentage van 30%, en int zo'n $280.000 per maand. Dat transferpercentage van 30% is een zakelijke beslissing, geen platformstandaard.

Matic Insurance: Operatorbot buiten kantooruren die support, afspraakbevestiging en intake afhandelt. In Q1 handelde de bot ongeveer 8.000 gesprekken af, met antwoordpercentages die beter waren dan de door mensen geleide baseline. De bot zit bovenop de bestaande Twilio-relatie van Matic.

Het patroon over alle drie:

  • Platform bezit de agent-laag
  • De bestaande systemen van de klant bezitten de data en workflows
  • De carrier-relatie is een apart contract

Dat is de grens tussen bundelen en bring-your-own in echte productie-implementaties.

Veelgestelde vragen

Heb ik een ElevenLabs-abonnement nodig om een voice-AI-platform te gebruiken?

Nee. Stemmen zijn ingebed in de prijs per minuut. De uitzondering is enterprise stemklonen, die apart wordt geconfigureerd.

Is Twilio vereist om een AI-stemagent te draaien?

Nee. De meeste platforms ondersteunen Telnyx, Vonage, Avaya en elke SIP-compatibele carrier via directe trunking, plus hun eigen ingebouwde nummers. Twilio domineert het gesprek alleen omdat het de meest voorkomende bestaande carrier is.

Kan ik mijn eigen LLM meenemen?

Ja. Custom LLM's worden ondersteund via een WebSocket-integratie, inclusief OpenAI Enterprise-contracten, de Anthropic-API, Gemini en self-hosted modellen. Je betaalt je modelprovider voor inferentie en het platform voor orkestratie.

Hoe verhoudt de gebundelde prijs zich tot een DIY-build op Twilio + OpenAI + ElevenLabs?

De volledige, alles-inbegrepen kosten belanden grofweg in hetzelfde bereik: tussen $0,13 en $0,31 per minuut. De economie per minuut is niet de doorslaggevende factor. De doorslaggevende factor is de engineeringtijd die je bespaart op de orkestratielaag, wat doorgaans maanden is.

Wat omvat de orkestratielaag?

Audio in chunks streamen, buffering op zinsgrenzen tussen het taalmodel en TTS, beurtwisseling en barge-in, function calling tijdens een live gesprek, retry en failover over de onderliggende API's, simulatietests, transcripten met sentimentscoring, en een geΓΌnificeerd observability-dashboard.

Kan ik een voice-AI-platform gebruiken voor outbound calling op schaal?

Ja. Batchgesprekken ondersteunen uitgaande campagnes met 20 gratis gelijktijdige gesprekken op elk account. Veelvoorkomende use cases zijn onder meer AI-telemarketing, leadkwalificatie, opvolging van incasso, en afspraakherinneringen. TCPA- en STIR/SHAKEN-compliance worden op carrierniveau geconfigureerd.

Wat gebeurt er als de agent een gesprek niet kan afhandelen?

Warme doorverbinding met volledige gesprekscontext. De mens die opneemt ziet het transcript en de gestructureerde data die de agent heeft verzameld, zodat de beller zichzelf niet hoeft te herhalen. Escalatiedrempels (mislukte verhelderingspogingen, gevoelige onderwerpen, expliciete verzoeken van de beller) worden per agent geconfigureerd.

Is het platform geschikt voor gereguleerde sectoren?

Ja. SOC 2 Type II, HIPAA met een selfservice-BAA, GDPR en PII-redactie zijn inbegrepen. On-premise-implementatie is beschikbaar voor teams met strikte eisen voor dataresidentie.

Hoe lang duurt het om van aanmelding naar een live agent te gaan?

De meeste teams hebben binnen een uur een werkend testgesprek en binnen 1–2 weken een productieklare agent. Het platform verwerkt 50+ miljoen gesprekken per maand voor 3.000+ bedrijven, dus de implementatieroute is goed uitgestippeld.

De aankoopbeslissing in één alinea

De vier realtime-onderdelen (telefonie, transcriptie, taalmodel, stemsynthese) worden snel commodity's. Iedereen kan ze kopen. De orkestratie die ze omzet in een telefoongesprek dat je een klant zou laten horen, is waar de engineering zich opstapelt, en dat is waarom een platformfee per minuut het waard is om in 2026 te betalen.

De snelste manier om te voelen waar de grens ligt, is een echt gesprek voeren. De aanmelding van Retell AI omvat $10 aan gebruikstegoed, wat genoeg is om een testagent uit te rollen tegen je eigen nummer en te zien waar je bestaande systemen inpluggen versus wat het platform end-to-end afhandelt.

Van daaruit is de natuurlijke volgende stap welke workflow er ook het meest toe doet:

  • AI-klantenservice voor inbound-deflectie
  • Een AI-IVR-vervanging voor de telefoonkeuzeboom die je bellers nu al haten
  • Een uitgaande campagne voor de leads in je CRM

Bouw met de $10 aan tegoed op retellai.com.

ROI Calculator
Estimate Your ROI from Automating Calls

See how much your business could save by switching to AI-powered voice agents.

All done!Β 
Your submission has been sent to your email
Oops! Something went wrong while submitting the form.
Β Β Β 1
Β Β Β 8
20
Oops! Something went wrong while submitting the form.

ROI Result

2,000

Total Human Agent Cost

$5,000
/month

AI Agent Cost

$3,000
/month

Estimated Savings

$2,000
/month
Live Demo
Probeer onze live demo

Een demodemonummer van Retell Clinic Office

Bedankt! Je inzending is ontvangen!
Oeps! Er is iets misgegaan bij het verzenden van het formulier.

Read Other Blogs

Revolutionize your call operation with Retell