Blogs
/
5 beste speech-to-text-modellen in 2026, getest en gerangschikt

5 beste speech-to-text-modellen in 2026, getest en gerangschikt

15
Β MIN READ
October 3, 2026
5 beste speech-to-text-modellen in 2026, getest en gerangschikt
BACK TO BLOGS
Add Retell AI as a preferred source on Google
ON THIS PAGE
Back to top

Ik heb vijf speech-to-text-modellen door dezelfde meedogenloze testset gehaald: 40 uur echte gespreksaudio op 8 kHz, inclusief namen met accenten, gespelde polisnummers, speakerphone-gesprekken uit rijdende auto's en twee mensen die door elkaar heen praten. Ik heb de word error rate gemeten tegen mijn eigen ground truth, de eerste-partial- en time-to-final-latency, en hoe elk model omging met de woorden die de transactie dragen.

De wereldwijde speech-to-text-markt ligt in 2026 rond de $3,87 miljard, en het grootste deel van die uitgaven loopt nu via een handvol modellen.

Als je voice-producten bouwt, ken je de valkuil al. Je feature demonstreert schoon op kantoor, komt dan productie-audio tegen en verminkt precies het ene woord dat ertoe deed, waardoor de agent de verkeerde datum inplant of het verkeerde account terugleest.

Deze gids rangschikt de modellen die die test overleven, vergelijkt nauwkeurigheid, latency, talen en prijs, en laat zien waar elk model zijn plek verdient in een echte voice-stack.

Speech-to-text-modellen gerangschikt: het oordeel in 60 seconden

  • AssemblyAI Universal-3 Pro: beste voor transcriptie met de hoogste nauwkeurigheid op moeilijke audio uit de praktijk
  • Retell AI: beste om speech-to-text om te zetten in een live stemagent die tijdens het gesprek handelt
  • Deepgram Nova-3: beste voor streaming met ultralage latency bij hoog gespreksvolume
  • OpenAI gpt-4o-transcribe: beste voor meertalige dekking binnen het OpenAI-ecosysteem
  • ElevenLabs Scribe v2: beste voor realtime meertalige transcriptie in meer dan 90 talen

Speech-to-text-model vergelijken: nauwkeurigheid, latency en kosten

FunctieAssemblyAI Universal-3 ProRetell AIDeepgram Nova-3OpenAI gpt-4o-transcribeElevenLabs Scribe v2
Beste voorAsync transcriptie met hoogste nauwkeurigheidLive stemagenten van begin tot eindStreaming met lage latency op schaalMeertalige ecosysteem-fitRealtime meertalig
Prijs$0,21/uur async$0,07/min all-in agent$0,0043/min batch, $0,0077/min stream$0,006/min, mini $0,003/minOp gebruik gebaseerd, ~$0,22/1K tokens
Transcriptienauwkeurigheid (WER)5,6% gemiddeld, 4,9% mediaanAfhankelijk van de engine5,26%~8,9% onafhankelijkLeidt meertalige benchmarks
Realtime latency~760ms time-to-final~600ms volledige round tripOnder 300ms500-1500ms eerste chunk~150ms eerste partial
Streaming STTJa, Universal-3 RT ProJa, ingebouwd in de agentJa, native plus FluxBeperkt, via Realtime APIJa, Scribe v2 Realtime
Talen~20, 6 kern-code-switching31+~10 streaming, 36 batch99+90+
Klaar voor stemagentenAlleen STT, combineer met LLM/TTSVolledige agent met turn-takingSTT plus Flux-turndetectieRealtime speech-to-speechSTT plus Agents-platform
DiarisatieJaAfgehandeld op telefonielaagJa, apart geprijsdJa, diarize-variantJa, 98% sprekernauwkeurigheid
ComplianceSOC 2, HIPAA BAASOC 2 Type II, HIPAA BAA, GDPRSOC 2, HIPAA, self-hostSOC 2, zero-retention-optieSOC 2, ISO 27001, PCI DSS, HIPAA
Gratis tegoed$50$10$200$5Gratis tier

Gegevens afkomstig van officiΓ«le productpagina's en praktijktests per juni 2026.

Wat een speech-to-text-model moet doen voor voice-bouwers in 2026

Een speech-to-text-model zet gesproken audio om in geschreven tekst door de meest waarschijnlijke woordvolgorde uit een akoestisch signaal te voorspellen. De metric die iedereen aanhaalt, is de word error rate, het percentage woorden dat is vervangen, ingevoegd of verwijderd ten opzichte van een menselijke referentie. Neurale modellen domineren de categorie nu, en in klantenservice en IVR zijn ze de standaardspecificatie geworden in plaats van een upgrade, een verschuiving die zichtbaar is in de bredere data over adoptie van neurale stem.

Het detail dat kopers doet struikelen, is waar het model voor bedoeld is. Een transcriptiemodel geeft tekst terug. Een stemagent moet in realtime horen, begrijpen en antwoorden, wat betekent dat het model één fase is in een pijplijn die ook een LLM, een stem en turn-taking nodig heeft. De eerste groep geeft om nauwkeurigheid en prijs. De tweede groep staat of valt met latency over de hele loop.

De 5 beste speech-to-text-modellen, getest op echte gespreksaudio

Elk model hieronder is beoordeeld op dezelfde vijf criteria met dezelfde testset. Ik rapporteer wat ik heb gemeten en waar elk model afbrak, niet wat de marketingpagina's beloven. De volgorde weerspiegelt de taak waarvoor elke tool is gebouwd.

1. AssemblyAI Universal-3 Pro: beste voor async transcriptie met de hoogste nauwkeurigheid

Wat doet het? Een promptbaar spraaktaalmodel dat transcripten met hoge nauwkeurigheid teruggeeft op luidruchtige, accentrijke en technische audio.

Voor wie is het? Teams van wie het product ervan afhangt dat namen, cijfers en domeintermen precies goed komen.

CategorieScore
Transcriptienauwkeurigheid9,8/10
Realtime latency8,0/10
Meertalige ondersteuning7,5/10
Productiegereedheid9,0/10
Gemak van installatie9,0/10
Totaal9,4/10

Ik voerde Universal-3 Pro een reeks incassogesprekken waarin bellers accountnummers spelden boven achtergrondgeluid, en het gaf een word error rate van 4,7% op mijn set terug, de laagste van alle modellen die ik testte. Op een klinische opname met medicijnnamen en doseringen ving zijn medische verwerking termen op die de anderen benaderden, wat overeenkomt met de ongeveer 4,9% medische entity-error-rate die AssemblyAI publiceert tegenover rivalen rond de 7%.

Wat me verraste, was de prompting. Ik gaf gewone Engelse context door vΓ³Γ³r de transcriptie, met de instructie om een gemengde Spaans-Engelse passage te behouden, en het hield elke zin in de oorspronkelijke taal in plaats van een vertaling af te dwingen.

Die nauwkeurigheid op moeilijke input sluit aan bij onderzoek naar spraak met accent dat laat zien hoezeer disfluentie en niet-moedertaalspraak zwakkere modellen nog steeds afstraffen.

Het addertje is de latency. Universal-3 Pro is async-first, en hoewel de nieuwe RT Pro het naar streaming brengt, lag mijn time-to-final op live audio rond de 760ms, trager dan Deepgram voor een stemagent op het hot path. Voor opgenomen bestanden, podcasts en analyse na het gesprek is het de nauwkeurigheidsleider.

Pluspunten

  • Laagste word error rate in mijn tests met 4,7% op luidruchtige incasso-audio
  • Promptbare transcriptie stuurt de nauwkeurigheid voordat het model luistert
  • Sterk in medische termen, gespelde cijfers en code-switching over zes kerntalen
  • $50 aan gratis tegoed om op je eigen bestanden te benchmarken

Minpunten

  • Streaming-latency rond de 760ms blijft achter bij speciaal gebouwde stemagent-engines
  • Taaldekking van ongeveer 20 is smaller dan OpenAI of ElevenLabs

Prijs $0,21 per uur voor Universal-3 Pro async, met volumekortingen en geen rate limits. Realtime streaming wordt apart gefactureerd op Universal-3 RT Pro.

2. Retell AI: beste om speech-to-text om te zetten in een live stemagent

Wat doet het? Een platform dat spraakherkenning, een LLM, een stem en eigen turn-taking als één agent laat draaien die telefoongesprekken beantwoordt en erop handelt.

Voor wie is het? Teams van wie het echte doel een werkende telefoonagent is, niet een ruw transcript.

CategorieScore
Transcriptienauwkeurigheid9,0/10
Realtime latency9,5/10
Meertalige ondersteuning8,5/10
Productiegereedheid9,5/10
Gemak van installatie9,5/10
Totaal9,3/10

Ik stopte hier met het testen van transcripten en testte uitkomsten. Ik bouwde een inbound agent die een intake van vier vragen afwerkte, een slot inplande en elk gesprek naar analyse na het gesprek logde als een gescoord transcript met geΓ«xtraheerde velden. De volledige round trip van spraak naar gesproken antwoord mat ongeveer 600ms, snel genoeg dat twee testbellers niet doorhadden dat ze met AI spraken.

Het verschil tussen dit en een ruwe STT-API bleek uit herstel en context. Door een bedrijfskennisbank te koppelen, kon de agent beleidsvragen beantwoorden zonder dat ik elke vertakking hoefde te scripten, terwijl de eigen turn-taking barge-in afhandelde wanneer een beller er middenin een zin tussenkwam.

Het model hoorde, het systeem besliste, en de agent reageerde voordat de pauze ongemakkelijk werd.

Randgevallen die transcriptie-only-stacks breken, werden binnen de flow afgehandeld. Wanneer een beller in de war raakte, deed de agent een warme gespreksoverdracht met volledige gesprekscontext in plaats van de beller te laten vallen. Medical Data Systems draait dit op 100% van de inbound gesprekken met slechts 30% overdrachtspercentage, en int ongeveer $280.000 per maand.

Pluspunten

  • Ongeveer 600ms end-to-end-latency over de volledige horen-beslissen-reageren-loop
  • Eigen turn-taking handelt onderbrekingen en barge-in af, niet alleen transcriptie
  • No-code-builder plus volledige API, Custom LLM en SIP-telefonie zonder lock-in
  • Beproefd op meer dan 100M gesprekken per maand met SOC 2 Type II en HIPAA BAA
  • Meer dan 31 talen met automatische detectie vanuit één agent

Minpunten

  • Geen standalone STT-API; voor pure batchtranscriptie van opgenomen bestanden is een ruw model goedkoper

Prijs $0,07 per minuut all-in voor de agent, zonder platformkosten en met $10 aan gratis tegoed. Die minuut dekt spraakherkenning, de LLM, de stem en telefonie samen.

3. Deepgram Nova-3: beste voor streaming met ultralage latency op schaal

Wat doet het? Een streaming-first speech-to-text-model, ontworpen voor transcripten onder 300ms op live audio.

Voor wie is het? Engineeringteams waar latency de belangrijkste KPI is en het gespreksvolume hoog is.

CategorieScore
Transcriptienauwkeurigheid9,0/10
Realtime latency9,5/10
Meertalige ondersteuning7,0/10
Productiegereedheid9,0/10
Gemak van installatie8,5/10
Totaal9,0/10

Ik streamde dezelfde live gespreksaudio naar Nova-3 en zag consequent partiΓ«le transcripten onder 300ms terugkomen, het snelste pure-STT-resultaat in de groep. Op schoon Engels rapporteerde het een word error rate van 5,26% op zijn eigen praktijkset, en op mijn luidruchtige audio bleef het binnen twee punten van AssemblyAI terwijl het woorden veel sneller teruggaf.

Facturering per seconde hielp bij korte uitingen. Een "hello" van één woord werd als één seconde gefactureerd in plaats van een naar boven afgerond blok, wat oploopt over spraakzame agent-gesprekken.

Deepgram levert ook Flux, een apart model met ingebouwde end-of-turn-detectie, dus ik hoefde geen voice-activity-detectie erop te bouwen om te voorkomen dat de bot onderbrak.

De afweging is de breedte. Nova-3 streaming dekt ongeveer tien talen tegenover de bredere dekking van OpenAI en ElevenLabs, en diarisatie wordt als add-on geprijsd. Voor een English-first stemagent die vooral snelheid nodig heeft, is het de standaard-engine op het hot path.

Pluspunten

  • Streaming-latency onder 300ms, snelste ruwe STT in mijn tests
  • Facturering per seconde vermijdt afrondingsboetes op korte gesprekken
  • Flux-model voegt native turndetectie toe voor stemagenten
  • Self-hosted deployment beschikbaar voor strikte dataresidentie

Minpunten

  • Streaming-taaldekking rond de tien blijft achter bij meertalige koplopers
  • Diarisatie en diverse add-ons worden apart gefactureerd
  • Streaming voor $0,0077 per minuut kost ongeveer 80% meer dan batch

Prijs $0,0043 per minuut batch en $0,0077 per minuut streaming op betalen naar gebruik, met $200 aan gratis tegoed. Flux voor stemagenten begint bij $0,0065 per minuut.

4. OpenAI gpt-4o-transcribe: beste voor meertalige ecosysteem-fit

Wat doet het? Een transcriptiemodel op basis van GPT-4o dat het verouderde Whisper vervangt met lagere foutpercentages over meer dan 99 talen.

Voor wie is het? Teams die al op OpenAI bouwen en één leverancier willen voor transcriptie- en LLM-werk.

CategorieScore
Transcriptienauwkeurigheid8,7/10
Realtime latency6,5/10
Meertalige ondersteuning9,0/10
Productiegereedheid8,0/10
Gemak van installatie9,0/10
Totaal8,3/10

Ik wisselde een Whisper-pijplijn om naar gpt-4o-transcribe door één modelstring te veranderen, en de woordfouten op mijn meertalige set daalden merkbaar, in lijn met de door OpenAI gerapporteerde 4,1% op schone benchmarks.

Op mijn moeilijkere telefonie-audio kwam het dichter bij de ongeveer 8,9% die onafhankelijke benchmarks rapporteren, wat het verschil is tussen studio en straat.

De echte winst is talen en eenvoud. Voor $0,006 per minuut, met een mini-tier van $0,003, handelde het meer dan 99 talen af zonder dat ik een aparte provider hoefde te zoeken, en de diarize-variant labelde sprekers in een tweegesprek binnen een punt of twee van speciaal gebouwde tools.

De zwakte voor stemagenten is streaming. Native transcriptie is batch-first, en realtime betekent overstappen naar de aparte Realtime API, waar mijn eerste transcript-chunk tussen 500 en 1500ms arriveerde. Voor opgenomen meertalige content binnen een OpenAI-stack is het een makkelijke keuze.

Pluspunten

  • Dekking van meer dan 99 talen met een bijna drop-in upgrade van Whisper
  • $0,006 per minuut, met een mini-tier van $0,003 voor schone audio
  • Sprekerdiarisatie beschikbaar op de diarize-variant
  • Sterk taalbegrip vanuit de GPT-4o-basis

Minpunten

  • Geen native realtime streaming; live gebruik vereist de aparte Realtime API
  • Onafhankelijke WER rond de 8,9% op luidruchtige audio blijft achter bij de nauwkeurigheidsleiders
  • Slechts $5 aan gratis tegoed om te testen

Prijs $0,006 per minuut voor gpt-4o-transcribe, $0,003 voor mini, en ongeveer $0,017 per minuut voor realtime transcriptie.

5. ElevenLabs Scribe v2: beste voor realtime meertalige transcriptie

Wat doet het? Een streaming-first speech-to-text-model dat transcripten met lage latency levert over meer dan 90 talen.

Voor wie is het? Bouwers die snelle, nauwkeurige transcriptie in veel talen nodig hebben voor agenten en live captions.

CategorieScore
Transcriptienauwkeurigheid8,8/10
Realtime latency9,0/10
Meertalige ondersteuning9,5/10
Productiegereedheid8,0/10
Gemak van installatie8,5/10
Totaal8,6/10

Ik streamde live audio naar Scribe v2 Realtime en zag eerste partials rond de 150ms terugkomen, het snelste eerste-token-resultaat in de groep, met predictieve transcriptie die de volgende woorden anticipeerde.

Over een mix van Engelse, Spaanse en Hindi-clips hield het de nauwkeurigheid vast waar zwakkere modellen afdreven, en het detecteerde automatisch taalwisselingen binnen één bestand zonder handmatige segmentatie.

Sprekerlabeling maakte indruk aan tafels met meerdere partijen, waar het beurten netjes taggde en entiteiten van tijdstempels voorzag voor redactie. Keyterm-prompting liet me tot 1000 zinnen richting productnamen en medicatie bijsturen, wat de fouten op merkgebonden termen verminderde.

De beperking is de volwassenheid als ruggengraat voor een callcenter. Realtime-diarisatie op niet-Engelse audio is nog ruw, en de productietooling is jonger dan die van Deepgram. Voor realtime meertalige transcriptie waar snelheid en taalbreedte allebei belangrijk zijn, is het de sterkste specialist.

Pluspunten

  • Ongeveer 150ms eerste-partial-latency, de snelste in mijn tests
  • Meer dan 90 talen met automatische multitaaldetectie
  • 98% nauwkeurigheid van sprekerlabels met entity-tijdstempels voor redactie
  • Keyterm-prompting stuurt tot 1000 zinnen bij voor technische woordenschat

Minpunten

  • Realtime-diarisatie op niet-Engelse audio is nog inconsistent
  • Productie-callcentertooling is minder volwassen dan die van streaming-rivalen
  • Token-gebaseerde prijzen zijn moeilijker te voorspellen dan tarieven per minuut

Prijs Op gebruik gebaseerd per audiominuut, met Scribe v2 rond de $0,22 per 1.000 tokens op instaptiers na recente verlagingen, plus een gratis tier om te beginnen.

Hoe ik deze speech-to-text-modellen rangschikte voor productie-voicewerk

Nauwkeurigheid op echte audio, niet op studiosamples

Gepubliceerde WER komt meestal uit schone opnames, en een model op 5% in een benchmark kan 15-20% raken op een luidruchtig gesprek. Ik scoorde elk model op mijn eigen 8 kHz-gespreksset en checkte dit tegen onafhankelijke benchmarks, zodat de rangschikking de productierealiteit weerspiegelt, niet een leaderboard.

Latency over de hele loop

Voor transcriptie is time-to-final het getal. Voor een stemagent draait het om de volledige round trip van spraak naar gesproken antwoord, want alles boven een seconde voelt als een walkietalkie. Ik woog streaming-latency zwaar voor de conversationele use cases.

Dekking van talen en code-switching

Een model dat wint in het Engels kan instorten op gesprekken met accent of gemengde taal. Ik testte Spaans-Engelse en Hindi-audio omdat neurale stem nu de standaard is in klantenservice over de hele spraakherkenningsmarkt, en bellers blijven niet eentalig.

Component of uitkomst

Het diepste criterium was de scope. Een ruw model geeft je tekst en laat de LLM, stem en turn-taking aan jou over. Een platform geeft je een agent. Ik scoorde elke tool tegen de taak waarvoor kopers hem inhuren, en daarom scheidt de rangschikking transcriptieleiders van agentplatforms.

Waar speech-to-text-modellen hun waarde bewijzen: 6 productie-use-cases

  1. Realtime agent-assist: Streaming STT voedt een live transcript aan menselijke agents of een LLM tijdens het gesprek, waar sub-seconde-latency suggesties synchroon houdt met de beller. Dit is waar Deepgram en de volledige loop van Retell voorop lopen.
  2. Automatisering van inbound gesprekken: Transcriptie wordt pas nuttig als er iets op handelt, en daarom koppelen agenten voor AI-klantenservice herkenning aan function calling om problemen op te lossen en accounts op te zoeken zonder mens.
  3. Leadkwalificatie: Uitgaande en inkomende gesprekken lopen door een script dat vraagt, scoort en routeert, en nauwkeurige transcriptie van namen en intentie zorgt voor schone leadkwalificatie in plaats van verhaspelde CRM-records.
  4. Afspraken inplannen: Een verkeerd verstane datum of tijd is een no-show, dus een AI-afsprakenplanner heeft zowel hoge nauwkeurigheid op cijfers als realtime bevestiging terug naar de beller nodig.
  5. Analyse na het gesprek en QA: Async nauwkeurigheidsleiders schitteren hier, door opgenomen gesprekken om te zetten in gescoorde transcripten, sentiment en compliance-flags in een markt die volgens data over spraakherkenningsgroei met ongeveer 20% per jaar groeit.
  6. Meertalige dekking: Bellers in veel talen bedienen vanuit één stack begunstigt modellen met brede dekking, waar ElevenLabs en OpenAI voorop lopen en Retell automatisch detecteert over meer dan 31 talen in één agent.

De grenzen van speech-to-text-modellen, en waar ze afbreken

  1. Luidruchtige audio en audio met accent doet nog steeds pijn. Zelfs koplopers verliezen enkele punten nauwkeurigheid op speakerphone, verkeer en zware accenten, dus productieteams beschouwen alles boven de 10% word error rate doorgaans als onbetrouwbaar voor compliance-grade werk.
  2. Streaming kost meer en dekt minder talen. Realtime-modi draaien 1,5 tot 2 keer de batchprijs en ondersteunen vaak een kortere talenlijst dan het async-model van dezelfde leverancier.
  3. Een transcript is geen uitkomst. Een model produceert tekst; het plant het slot niet in, werkt het CRM niet bij en verbindt het gesprek niet door. Teams die dit vergeten, leveren nauwkeurige transcripten die niets doen.
  4. Diarisatie en add-ons blazen de rekening op. Sprekerlabeling, redactie en keyterm-functies worden vaak apart geprijsd, dus het tarief per minuut op de voorpagina komt zelden overeen met de factuur.
  5. Latency stapelt zich op in de keten. Een traag transcript betekent een traag LLM-antwoord en een trage agent, en de ongemakkelijke pauzes stapelen zich op totdat bellers door de bot heen praten.

Van speech-to-text naar een live stemagent in dagen, niet maanden

Een model geeft je tekst. Een bedrijf heeft nodig dat het gesprek wordt beantwoord, de vraag wordt opgelost en de afspraak wordt ingepland. De vijf modellen hier zijn het juiste startpunt als transcriptie je product is, en AssemblyAI, Deepgram, OpenAI en ElevenLabs winnen elk een duidelijke baan.

Als je doel een telefoonagent is die hoort, begrijpt en handelt in één loop van ongeveer 600ms, heb je de laag boven het model nodig. Retell AI laat spraakherkenning, je keuze aan LLM, een ultrarealistische stem en eigen turn-taking als één productie-agent draaien, zonder platformkosten en met $10 aan gratis tegoed.

  • Ga live in dagen met een no-code-builder plus volledige API-toegang
  • Betaal $0,07 per minuut all-in, geen minimums of contracten
  • Schaal op infrastructuur bewezen op meer dan 100M gesprekken per maand

Begin vandaag gratis met het bouwen van je eerste AI-stemagent.

De conclusie: match het model aan de taak

Het kiezen van een speech-to-text-model in 2026 komt neer op één eerlijke vraag: wat gebeurt er met de tekst nadat het model die produceert? Als iemand het transcript later leest, bepalen nauwkeurigheid en prijs de winnaar, en de async-leiders zijn moeilijk te verslaan. Als een machine een beller moet horen, de intentie moet begrijpen en moet reageren voordat de stilte ongemakkelijk wordt, dan is het model slechts de eerste schakel in een langere keten, en telt de latency over de hele loop meer dan welke enkele benchmark ook.

De teams die betrouwbare voice-producten leveren, maken dat onderscheid vroeg. Ze testen op de audio die hun gebruikers in het wild produceren, luidruchtige lijnen en namen met accent inbegrepen, in plaats van op schone studiosamples. Ze meten de volledige round trip, niet het partiΓ«le transcript. En ze beslissen vooraf of ze een component of een uitkomst kopen. Krijg die beslissing goed en de shortlist versmalt zichzelf. Het moeilijke deel was nooit het model. Het was weten voor welke taak je het inhuurde.

Speech-to-text-modellen in 2026: vragen van kopers beantwoord

Welk speech-to-text-model heeft de laagste word error rate in 2026?

AssemblyAI Universal-3 Pro leidt op nauwkeurigheid, met een gerapporteerde gemiddelde WER van 5,6% en de laagste fouten op mijn luidruchtige gespreksset met 4,7%. Deepgram Nova-3 volgt met 5,26% op zijn eigen praktijkset terwijl het woorden veel sneller teruggeeft.

Heb ik een speech-to-text-model of een volledig stemagentplatform nodig?

Als je alleen transcripten van opgenomen bestanden nodig hebt, is een ruw model goedkoper en eenvoudiger. Als je een systeem nodig hebt dat een beller hoort en in realtime reageert, heb je de laag boven het model nodig, en daarom draait een AI-IVR-vervanging STT, een LLM, een stem en turn-taking samen.

Welk speech-to-text-model is het snelst voor live stemagenten?

ElevenLabs Scribe v2 Realtime gaf eerste partials rond de 150ms terug in mijn test, en Deepgram Nova-3 bleef onder 300ms time-to-final. Voor de volledige horen-beslissen-reageren-loop mat Retell ongeveer 600ms end to end, aangezien dat getal de LLM en het gesproken antwoord omvat, niet alleen transcriptie.

Hoeveel kosten speech-to-text-modellen per minuut op schaal?

Deepgram batch draait $0,0043 per minuut, OpenAI gpt-4o-transcribe is $0,006, en AssemblyAI async is $0,21 per uur. Een volledige agent-minuut die STT, LLM, stem en telefonie bundelt, is een andere eenheid, geprijsd rond de $0,07 per minuut.

Kunnen deze speech-to-text-modellen meertalige gesprekken en gesprekken met accent aan?

OpenAI dekt meer dan 99 talen en ElevenLabs dekt meer dan 90, waarmee ze de breedste zijn. AssemblyAI handelt code-switching over zes kerntalen af, en de nauwkeurigheid op audio met accent daalt nog steeds enkele punten voor elk model, dus test op je eigen bellers.

Zijn speech-to-text-modellen HIPAA-compliant voor gesprekken in de zorg?

De meeste koplopers bieden HIPAA-dekking onder een ondertekende BAA, waaronder AssemblyAI, Deepgram, ElevenLabs en Retell, waarvan de laatste ook SOC 2 Type II en GDPR draagt. Bevestig dat de BAA is uitgevoerd voordat je beschermde gezondheidsinformatie verstuurt, en controleer of redactie is inbegrepen of apart wordt gefactureerd. Setup-details voor ontwikkelaars staan in de documentatie.

Wat gebeurt er als een speech-to-text-model een cruciaal woord verkeerd verstaat?

In een transcriptie-only-stack stroomt de fout stilletjes stroomafwaarts en corrumpeert die het record. In een agent kan herstellogica een gespeld nummer opnieuw bevestigen of een warme doorverbinding activeren, en daarom ontwerpen productie-voiceteams voor misherkenning in plaats van aan te nemen dat het model altijd gelijk heeft.

ROI Calculator
Estimate Your ROI from Automating Calls

See how much your business could save by switching to AI-powered voice agents.

All done!Β 
Your submission has been sent to your email
Oops! Something went wrong while submitting the form.
Β Β Β 1
Β Β Β 8
20
Oops! Something went wrong while submitting the form.

ROI Result

2,000

Total Human Agent Cost

$5,000
/month

AI Agent Cost

$3,000
/month

Estimated Savings

$2,000
/month
Live Demo
Probeer onze live demo

Een demodemonummer van Retell Clinic Office

Bedankt! Je inzending is ontvangen!
Oeps! Er is iets misgegaan bij het verzenden van het formulier.

Read Other Blogs

Revolutionize your call operation with Retell