De meeste voice-AI-platforms bundelen vier onderdelen in één prijs per minuut: speech-to-text, het taalmodel, text-to-speech en de orkestratie die ze samenbrengt tot een realtime telefoongesprek. Telefonie komt binnen via SIP, maar de carrierminuten, de systemen waarmee je agent praat en de gesprekslogica zelf blijven van jou.
Dat is het hele antwoord. De rest van deze gids is voor kopers die telkens vastlopen op dezelfde evaluatievraag: "Wacht, hebben we aparte abonnementen nodig voor telefonie, TTS, STT en LLM's, of zit dit al in het platform?"
Als je in een gesprek met een leverancier hebt gezeten waarin een voice-AI-platform naast Twilio, ElevenLabs of OpenAI werd gelegd en je je afvroeg wat goedkoper is, dan is dit artikel het helderste antwoord dat je krijgt. Die leveranciers zitten niet in dezelfde kolom. Elk verkoopt één laag van de stack. Een platform als Retell AI verkoopt het georkestreerde geheel.
Weten welke laag je geld koopt, beantwoordt vier praktische vragen:
Elke voice-agent die de telefoon opneemt, draait dezelfde keten. Audio komt binnen. Die wordt getranscribeerd. Een model redeneert over het transcript. Het antwoord wordt uitgesproken. Alles streamt parallel.
| Laag | Wat het doet | Veelvoorkomende providers |
|---|---|---|
| Telefonie | Routeert audio tussen telefoon en server | Twilio, Telnyx, Vonage, Avaya |
| Speech-to-text (STT) | Zet audio om in tekst | Deepgram, AssemblyAI, Whisper |
| Taalmodel (LLM) | Leest, redeneert, beslist, antwoordt | GPT-5, GPT-4o, Claude 4.5, Gemini 3.0 |
| Text-to-speech (TTS) | Zet tekst om in gesproken audio | ElevenLabs, Cartesia, OpenAI, MiniMax |
| Orkestratie | Streamt, buffert, regelt beurtwisseling en tool-calls | Het voice-AI-platform |
De eerste vier zijn commodity's. Iedereen gebruikt grofweg dezelfde providers. De vijfde is waar teams stilletjes drie tot zes maanden engineering verbranden wanneer ze het zelf proberen te bouwen.
De verborgen kosten van "we knopen het zelf wel aan elkaar": Streaming WebSockets. Buffering op zinsgrenzen. Detectie van spraakactiviteit. Herstel na barge-in. Function calling midden in het gesprek. Retry-logica over vier API's. SIP-integratie die de eigenaardigheden van de 8 kHz-codec afhandelt. Niets daarvan werkt kant-en-klaar.
Nee. Niet met een platform. Met een voice-AI-platform onderteken je één overeenkomst en krijg je één factuur. Met kale infrastructuur onderteken je er vier.
In echte evaluaties duiken drie aankooproutes op:
1. Gebundeld platform: Eén contract, één factuur, één dashboard. Je kiest een stem en een LLM uit dropdowns; het platform regelt de licentie, API-calls en metering. Dit is wat de meeste teams de eerste 90 dagen kiezen.
2. Kale infrastructuur: Twilio + een STT-provider + een LLM-API + een TTS-provider, aan elkaar geplakt met je eigen orkestratiecode. Maximale controle, vier sets aan credentials, drie tot zes maanden engineering voordat je een echt gesprek voert.
3. Hybride bring-your-own: Het platform regelt orkestratie en componenten, maar je brengt je eigen SIP-trunk, fine-tuned model of stemkeys mee. Hier komen de meeste productie-implementaties na het eerste kwartaal terecht.
Het toptarief van een platform dekt de orkestratie. De componenten liggen daar bovenop, en het zijn transparante posten, geen verborgen kosten.
Zo valt een typisch mid-marketgesprek uiteen op de prijzen-pagina:
| Component | Typisch tarief | Opmerkingen |
|---|---|---|
| Basis-orkestratie | ~$0,07/min | Vast |
| Stem (Cartesia) | ~$0,05β$0,07/min | ElevenLabs/OpenAI liggen hoger |
| LLM | $0,003β$0,08/min | Gemini Flash goedkoopst, GPT-5 hoogst |
| Telefonie (ingebouwd) | ~$0,015/min | Of $0 met je eigen SIP-trunk |
| Alles inbegrepen (typisch) | $0,13β$0,20/min | Mid-tier stem + competent model |
Twee opmerkingen voordat je dit voor finance modelleert:
Ja, en ja. Het hangt af van wat je al hebt.
Je kunt rechtstreeks in het dashboard een telefoonnummer kopen en binnen een uur gesprekken beginnen aan te nemen. Je kunt ook een bestaand Twilio-, Telnyx-, Vonage- of Avaya-nummer via SIP-trunking meenemen en de doorverkochte carrier volledig overslaan. Beide routes gebruiken onderliggend dezelfde orkestratielaag.
Snelle beslisregel:
Je kunt later overstappen. Een nummer opnieuw importeren kost minuten, geen migratieplannen.
Nee. De stem die je uit een dropdown kiest, zit in de prijs per minuut.
Dit brengt veel evaluatiegesprekken in de war, omdat ElevenLabs twee verschillende producten verkoopt:
Als je een voice-AI-platform gebruikt, krijg je #2. Geen aparte API-key. Geen apart abonnement. Geen aparte factuur. De licentie en metering gebeuren op de backend.
Dezelfde logica geldt voor Cartesia, OpenAI TTS, MiniMax en de eigen stemmodellen van het platform. De enige uitzondering is enterprise stemklonen, die apart wordt geconfigureerd voor teams die een merkspecifieke stem nodig hebben.
Nee. Inferentie is gebundeld. Je kiest het model uit een dropdown en de prijs per minuut past zich aan:
Geen OpenAI-API-key aan jouw kant. Geen Anthropic-account. Geen Google Cloud-project.
Als je je eigen model wilt meenemen (fine-tuned weights, een OpenAI Enterprise-contract dat je al hebt ondertekend, of een self-hosted Llama-implementatie), ondersteunt het platform een custom LLM WebSocket. De integratiestappen staan in de documentatie.
Wanneer wordt bring-your-own-model de juiste keuze?
Voor iedereen anders is de gebundelde route sneller uit te rollen en makkelijker te wisselen wanneer een nieuw model verschijnt.
Hier komt het deel dat teams verrast. Het platform regelt het gesprek. Jij regelt het bedrijf dat het bedient.
| Jij brengt mee | Het platform regelt |
|---|---|
| Kennisbankinhoud (je servicecatalogus, prijzen, openingstijden, beleid) | RAG-retrieval en auto-sync |
| CRM en system of record | Webhook-calls tijdens het gesprek |
| Agenda- en boekingssysteem | Realtime beschikbaarheidscontroles en het aanmaken van afspraken |
| Ontwerp van de gespreksflow | Het drag-and-drop-framework om het in te bouwen |
| Escalatieregels en routering | De warme doorverbinding met volledige context |
Een paar opmerkingen die het waard zijn om te noemen:
Het kostenverschil is klein. Het tijdsverschil is enorm.
| Gebundeld platform | Bring-your-own-build | |
|---|---|---|
| Leveranciersrelaties | 1 | 4+ |
| Tijd tot eerste live gesprek | Minder dan een uur | 3β6 maanden |
| Volledige kost per minuut | $0,13β$0,20 | $0,13β$0,31 |
| Vereiste engineering | Prompt + flow-ontwerp | Streaming-pipeline + retry-logica + observability + SIP-afhandeling |
| Compliance-keten | EΓ©n BAA | EΓ©n per leverancier in de stack |
Een typische bring-your-own-build haalt Twilio voor telefonie, Deepgram of AssemblyAI voor transcriptie, GPT-5 of Claude 4.5 voor redenering, ElevenLabs of Cartesia voor stem, en Pipecat of LiveKit voor orkestratie. Het rekensommetje per minuut belandt grofweg in dezelfde buurt als een gebundeld platform.
Waar je voor betaalt wanneer je bouwt, is engineeringtijd. Detectie van spraakactiviteit, barge-in-afhandeling, function calling die storingen midden in het gesprek overleeft, observability die vier leveranciersdashboards tot één trace correleert, en SIP-integratie die de eigenaardigheden van de 8 kHz-codec van telefonie-audio soepel afhandelt. Niets daarvan werkt kant-en-klaar.
De meeste moderne transcriptiemodellen zijn primair getraind op 16 kHz-audio. Telefonie geeft je 8 kHz. Het nauwkeurigheidsverschil op een vers gebouwde pipeline is echt en merkbaar voor bellers.
Dat verschil tussen maanden aan leidingwerk en dagen aan prompt engineering is de reden waarom de meeste productie-voice-agents in 2026 op een platform draaien.
Twilio, ElevenLabs, OpenAI en Retell AI concurreren niet om dezelfde dollar. Het zijn gestapelde lagen in dezelfde architectuur:
De juiste framing is zelden "Retell of Twilio". Het is "Retell bovenop Twilio". Hetzelfde geldt voor OpenAI en ElevenLabs. De enige echte overlap zit op de orkestratielaag, en de Retell vs ElevenLabs-pagina behandelt die smallere vergelijking voor teams die kiezen tussen een platform en het eigen end-to-end-product van ElevenLabs.
Compliance zit op de platformlaag. SOC 2 Type II, HIPAA met een selfservice-BAA, en GDPR zijn inbegrepen zonder compliance-toeslagen per minuut.
Waar dit het meest telt, is de ontbundelde build. Compliance stopt niet bij de orkestratie in een aan elkaar geplakte stack. Elke leverancier in de keten (STT, LLM, TTS, telefonie) heeft zijn eigen BAA-proces, zijn eigen voorwaarden voor gegevensverwerking en zijn eigen audit trail. Inkoopteams in de gezondheidszorg, verzekeringen en financiΓ«le dienstverlening kiezen meestal alleen daarom al voor de bundel.
EΓ©n leveranciersgoedkeuring gaat sneller dan vier.
Drie implementaties maken de afweging concreet:
Anker: Voice-automatisering over wereldwijde supportcenters die miljoenen gesprekken per jaar afhandelen in Noord-Amerika, Europa en AziΓ«. De agents halen 95%+ spraakherkenningsnauwkeurigheid in Engelstalige markten, en draaien bovenop de bestaande telefonie van Anker in plaats van op een pipeline met vier leveranciers.
Medical Data Systems: Incasso-operaties via het platform. Het team handelt nu 100% van de inkomende gesprekken af met slechts een transferpercentage van 30%, en int zo'n $280.000 per maand. Dat transferpercentage van 30% is een zakelijke beslissing, geen platformstandaard.
Matic Insurance: Operatorbot buiten kantooruren die support, afspraakbevestiging en intake afhandelt. In Q1 handelde de bot ongeveer 8.000 gesprekken af, met antwoordpercentages die beter waren dan de door mensen geleide baseline. De bot zit bovenop de bestaande Twilio-relatie van Matic.
Het patroon over alle drie:
Dat is de grens tussen bundelen en bring-your-own in echte productie-implementaties.
Heb ik een ElevenLabs-abonnement nodig om een voice-AI-platform te gebruiken?
Nee. Stemmen zijn ingebed in de prijs per minuut. De uitzondering is enterprise stemklonen, die apart wordt geconfigureerd.
Is Twilio vereist om een AI-stemagent te draaien?
Nee. De meeste platforms ondersteunen Telnyx, Vonage, Avaya en elke SIP-compatibele carrier via directe trunking, plus hun eigen ingebouwde nummers. Twilio domineert het gesprek alleen omdat het de meest voorkomende bestaande carrier is.
Kan ik mijn eigen LLM meenemen?
Ja. Custom LLM's worden ondersteund via een WebSocket-integratie, inclusief OpenAI Enterprise-contracten, de Anthropic-API, Gemini en self-hosted modellen. Je betaalt je modelprovider voor inferentie en het platform voor orkestratie.
Hoe verhoudt de gebundelde prijs zich tot een DIY-build op Twilio + OpenAI + ElevenLabs?
De volledige, alles-inbegrepen kosten belanden grofweg in hetzelfde bereik: tussen $0,13 en $0,31 per minuut. De economie per minuut is niet de doorslaggevende factor. De doorslaggevende factor is de engineeringtijd die je bespaart op de orkestratielaag, wat doorgaans maanden is.
Wat omvat de orkestratielaag?
Audio in chunks streamen, buffering op zinsgrenzen tussen het taalmodel en TTS, beurtwisseling en barge-in, function calling tijdens een live gesprek, retry en failover over de onderliggende API's, simulatietests, transcripten met sentimentscoring, en een geΓΌnificeerd observability-dashboard.
Kan ik een voice-AI-platform gebruiken voor outbound calling op schaal?
Ja. Batchgesprekken ondersteunen uitgaande campagnes met 20 gratis gelijktijdige gesprekken op elk account. Veelvoorkomende use cases zijn onder meer AI-telemarketing, leadkwalificatie, opvolging van incasso, en afspraakherinneringen. TCPA- en STIR/SHAKEN-compliance worden op carrierniveau geconfigureerd.
Wat gebeurt er als de agent een gesprek niet kan afhandelen?
Warme doorverbinding met volledige gesprekscontext. De mens die opneemt ziet het transcript en de gestructureerde data die de agent heeft verzameld, zodat de beller zichzelf niet hoeft te herhalen. Escalatiedrempels (mislukte verhelderingspogingen, gevoelige onderwerpen, expliciete verzoeken van de beller) worden per agent geconfigureerd.
Is het platform geschikt voor gereguleerde sectoren?
Ja. SOC 2 Type II, HIPAA met een selfservice-BAA, GDPR en PII-redactie zijn inbegrepen. On-premise-implementatie is beschikbaar voor teams met strikte eisen voor dataresidentie.
Hoe lang duurt het om van aanmelding naar een live agent te gaan?
De meeste teams hebben binnen een uur een werkend testgesprek en binnen 1β2 weken een productieklare agent. Het platform verwerkt 50+ miljoen gesprekken per maand voor 3.000+ bedrijven, dus de implementatieroute is goed uitgestippeld.
De vier realtime-onderdelen (telefonie, transcriptie, taalmodel, stemsynthese) worden snel commodity's. Iedereen kan ze kopen. De orkestratie die ze omzet in een telefoongesprek dat je een klant zou laten horen, is waar de engineering zich opstapelt, en dat is waarom een platformfee per minuut het waard is om in 2026 te betalen.
De snelste manier om te voelen waar de grens ligt, is een echt gesprek voeren. De aanmelding van Retell AI omvat $10 aan gebruikstegoed, wat genoeg is om een testagent uit te rollen tegen je eigen nummer en te zien waar je bestaande systemen inpluggen versus wat het platform end-to-end afhandelt.
Van daaruit is de natuurlijke volgende stap welke workflow er ook het meest toe doet:
Bouw met de $10 aan tegoed op retellai.com.
See how much your business could save by switching to AI-powered voice agents.
Total Human Agent Cost
AI Agent Cost
Estimated Savings
Een demodemonummer van Retell Clinic Office

Start building smarter conversations today.


.avif)
.avif)