5 beste speech-to-text-modellen in 2026, getest en gerangschikt


Ik heb vijf speech-to-text-modellen door dezelfde meedogenloze testset gehaald: 40 uur echte gespreksaudio op 8 kHz, inclusief namen met accenten, gespelde polisnummers, speakerphone-gesprekken uit rijdende auto's en twee mensen die door elkaar heen praten. Ik heb de word error rate gemeten tegen mijn eigen ground truth, de eerste-partial- en time-to-final-latency, en hoe elk model omging met de woorden die de transactie dragen.
De wereldwijde speech-to-text-markt ligt in 2026 rond de $3,87 miljard, en het grootste deel van die uitgaven loopt nu via een handvol modellen.
Als je voice-producten bouwt, ken je de valkuil al. Je feature demonstreert schoon op kantoor, komt dan productie-audio tegen en verminkt precies het ene woord dat ertoe deed, waardoor de agent de verkeerde datum inplant of het verkeerde account terugleest.
Deze gids rangschikt de modellen die die test overleven, vergelijkt nauwkeurigheid, latency, talen en prijs, en laat zien waar elk model zijn plek verdient in een echte voice-stack.
| Functie | AssemblyAI Universal-3 Pro | Retell AI | Deepgram Nova-3 | OpenAI gpt-4o-transcribe | ElevenLabs Scribe v2 |
|---|---|---|---|---|---|
| Beste voor | Async transcriptie met hoogste nauwkeurigheid | Live stemagenten van begin tot eind | Streaming met lage latency op schaal | Meertalige ecosysteem-fit | Realtime meertalig |
| Prijs | $0,21/uur async | $0,07/min all-in agent | $0,0043/min batch, $0,0077/min stream | $0,006/min, mini $0,003/min | Op gebruik gebaseerd, ~$0,22/1K tokens |
| Transcriptienauwkeurigheid (WER) | 5,6% gemiddeld, 4,9% mediaan | Afhankelijk van de engine | 5,26% | ~8,9% onafhankelijk | Leidt meertalige benchmarks |
| Realtime latency | ~760ms time-to-final | ~600ms volledige round trip | Onder 300ms | 500-1500ms eerste chunk | ~150ms eerste partial |
| Streaming STT | Ja, Universal-3 RT Pro | Ja, ingebouwd in de agent | Ja, native plus Flux | Beperkt, via Realtime API | Ja, Scribe v2 Realtime |
| Talen | ~20, 6 kern-code-switching | 31+ | ~10 streaming, 36 batch | 99+ | 90+ |
| Klaar voor stemagenten | Alleen STT, combineer met LLM/TTS | Volledige agent met turn-taking | STT plus Flux-turndetectie | Realtime speech-to-speech | STT plus Agents-platform |
| Diarisatie | Ja | Afgehandeld op telefonielaag | Ja, apart geprijsd | Ja, diarize-variant | Ja, 98% sprekernauwkeurigheid |
| Compliance | SOC 2, HIPAA BAA | SOC 2 Type II, HIPAA BAA, GDPR | SOC 2, HIPAA, self-host | SOC 2, zero-retention-optie | SOC 2, ISO 27001, PCI DSS, HIPAA |
| Gratis tegoed | $50 | $10 | $200 | $5 | Gratis tier |
Gegevens afkomstig van officiΓ«le productpagina's en praktijktests per juni 2026.
Een speech-to-text-model zet gesproken audio om in geschreven tekst door de meest waarschijnlijke woordvolgorde uit een akoestisch signaal te voorspellen. De metric die iedereen aanhaalt, is de word error rate, het percentage woorden dat is vervangen, ingevoegd of verwijderd ten opzichte van een menselijke referentie. Neurale modellen domineren de categorie nu, en in klantenservice en IVR zijn ze de standaardspecificatie geworden in plaats van een upgrade, een verschuiving die zichtbaar is in de bredere data over adoptie van neurale stem.
Het detail dat kopers doet struikelen, is waar het model voor bedoeld is. Een transcriptiemodel geeft tekst terug. Een stemagent moet in realtime horen, begrijpen en antwoorden, wat betekent dat het model één fase is in een pijplijn die ook een LLM, een stem en turn-taking nodig heeft. De eerste groep geeft om nauwkeurigheid en prijs. De tweede groep staat of valt met latency over de hele loop.
Elk model hieronder is beoordeeld op dezelfde vijf criteria met dezelfde testset. Ik rapporteer wat ik heb gemeten en waar elk model afbrak, niet wat de marketingpagina's beloven. De volgorde weerspiegelt de taak waarvoor elke tool is gebouwd.
Wat doet het? Een promptbaar spraaktaalmodel dat transcripten met hoge nauwkeurigheid teruggeeft op luidruchtige, accentrijke en technische audio.
Voor wie is het? Teams van wie het product ervan afhangt dat namen, cijfers en domeintermen precies goed komen.
| Categorie | Score |
|---|---|
| Transcriptienauwkeurigheid | 9,8/10 |
| Realtime latency | 8,0/10 |
| Meertalige ondersteuning | 7,5/10 |
| Productiegereedheid | 9,0/10 |
| Gemak van installatie | 9,0/10 |
| Totaal | 9,4/10 |
Ik voerde Universal-3 Pro een reeks incassogesprekken waarin bellers accountnummers spelden boven achtergrondgeluid, en het gaf een word error rate van 4,7% op mijn set terug, de laagste van alle modellen die ik testte. Op een klinische opname met medicijnnamen en doseringen ving zijn medische verwerking termen op die de anderen benaderden, wat overeenkomt met de ongeveer 4,9% medische entity-error-rate die AssemblyAI publiceert tegenover rivalen rond de 7%.
Wat me verraste, was de prompting. Ik gaf gewone Engelse context door vΓ³Γ³r de transcriptie, met de instructie om een gemengde Spaans-Engelse passage te behouden, en het hield elke zin in de oorspronkelijke taal in plaats van een vertaling af te dwingen.
Die nauwkeurigheid op moeilijke input sluit aan bij onderzoek naar spraak met accent dat laat zien hoezeer disfluentie en niet-moedertaalspraak zwakkere modellen nog steeds afstraffen.
Het addertje is de latency. Universal-3 Pro is async-first, en hoewel de nieuwe RT Pro het naar streaming brengt, lag mijn time-to-final op live audio rond de 760ms, trager dan Deepgram voor een stemagent op het hot path. Voor opgenomen bestanden, podcasts en analyse na het gesprek is het de nauwkeurigheidsleider.
Pluspunten
Minpunten
Prijs $0,21 per uur voor Universal-3 Pro async, met volumekortingen en geen rate limits. Realtime streaming wordt apart gefactureerd op Universal-3 RT Pro.
Wat doet het? Een platform dat spraakherkenning, een LLM, een stem en eigen turn-taking als één agent laat draaien die telefoongesprekken beantwoordt en erop handelt.
Voor wie is het? Teams van wie het echte doel een werkende telefoonagent is, niet een ruw transcript.
| Categorie | Score |
|---|---|
| Transcriptienauwkeurigheid | 9,0/10 |
| Realtime latency | 9,5/10 |
| Meertalige ondersteuning | 8,5/10 |
| Productiegereedheid | 9,5/10 |
| Gemak van installatie | 9,5/10 |
| Totaal | 9,3/10 |
Ik stopte hier met het testen van transcripten en testte uitkomsten. Ik bouwde een inbound agent die een intake van vier vragen afwerkte, een slot inplande en elk gesprek naar analyse na het gesprek logde als een gescoord transcript met geΓ«xtraheerde velden. De volledige round trip van spraak naar gesproken antwoord mat ongeveer 600ms, snel genoeg dat twee testbellers niet doorhadden dat ze met AI spraken.
Het verschil tussen dit en een ruwe STT-API bleek uit herstel en context. Door een bedrijfskennisbank te koppelen, kon de agent beleidsvragen beantwoorden zonder dat ik elke vertakking hoefde te scripten, terwijl de eigen turn-taking barge-in afhandelde wanneer een beller er middenin een zin tussenkwam.
Het model hoorde, het systeem besliste, en de agent reageerde voordat de pauze ongemakkelijk werd.
Randgevallen die transcriptie-only-stacks breken, werden binnen de flow afgehandeld. Wanneer een beller in de war raakte, deed de agent een warme gespreksoverdracht met volledige gesprekscontext in plaats van de beller te laten vallen. Medical Data Systems draait dit op 100% van de inbound gesprekken met slechts 30% overdrachtspercentage, en int ongeveer $280.000 per maand.
Pluspunten
Minpunten
Prijs $0,07 per minuut all-in voor de agent, zonder platformkosten en met $10 aan gratis tegoed. Die minuut dekt spraakherkenning, de LLM, de stem en telefonie samen.
Wat doet het? Een streaming-first speech-to-text-model, ontworpen voor transcripten onder 300ms op live audio.
Voor wie is het? Engineeringteams waar latency de belangrijkste KPI is en het gespreksvolume hoog is.
| Categorie | Score |
|---|---|
| Transcriptienauwkeurigheid | 9,0/10 |
| Realtime latency | 9,5/10 |
| Meertalige ondersteuning | 7,0/10 |
| Productiegereedheid | 9,0/10 |
| Gemak van installatie | 8,5/10 |
| Totaal | 9,0/10 |
Ik streamde dezelfde live gespreksaudio naar Nova-3 en zag consequent partiΓ«le transcripten onder 300ms terugkomen, het snelste pure-STT-resultaat in de groep. Op schoon Engels rapporteerde het een word error rate van 5,26% op zijn eigen praktijkset, en op mijn luidruchtige audio bleef het binnen twee punten van AssemblyAI terwijl het woorden veel sneller teruggaf.
Facturering per seconde hielp bij korte uitingen. Een "hello" van één woord werd als één seconde gefactureerd in plaats van een naar boven afgerond blok, wat oploopt over spraakzame agent-gesprekken.
Deepgram levert ook Flux, een apart model met ingebouwde end-of-turn-detectie, dus ik hoefde geen voice-activity-detectie erop te bouwen om te voorkomen dat de bot onderbrak.
De afweging is de breedte. Nova-3 streaming dekt ongeveer tien talen tegenover de bredere dekking van OpenAI en ElevenLabs, en diarisatie wordt als add-on geprijsd. Voor een English-first stemagent die vooral snelheid nodig heeft, is het de standaard-engine op het hot path.
Pluspunten
Minpunten
Prijs $0,0043 per minuut batch en $0,0077 per minuut streaming op betalen naar gebruik, met $200 aan gratis tegoed. Flux voor stemagenten begint bij $0,0065 per minuut.
Wat doet het? Een transcriptiemodel op basis van GPT-4o dat het verouderde Whisper vervangt met lagere foutpercentages over meer dan 99 talen.
Voor wie is het? Teams die al op OpenAI bouwen en één leverancier willen voor transcriptie- en LLM-werk.
| Categorie | Score |
|---|---|
| Transcriptienauwkeurigheid | 8,7/10 |
| Realtime latency | 6,5/10 |
| Meertalige ondersteuning | 9,0/10 |
| Productiegereedheid | 8,0/10 |
| Gemak van installatie | 9,0/10 |
| Totaal | 8,3/10 |
Ik wisselde een Whisper-pijplijn om naar gpt-4o-transcribe door één modelstring te veranderen, en de woordfouten op mijn meertalige set daalden merkbaar, in lijn met de door OpenAI gerapporteerde 4,1% op schone benchmarks.
Op mijn moeilijkere telefonie-audio kwam het dichter bij de ongeveer 8,9% die onafhankelijke benchmarks rapporteren, wat het verschil is tussen studio en straat.
De echte winst is talen en eenvoud. Voor $0,006 per minuut, met een mini-tier van $0,003, handelde het meer dan 99 talen af zonder dat ik een aparte provider hoefde te zoeken, en de diarize-variant labelde sprekers in een tweegesprek binnen een punt of twee van speciaal gebouwde tools.
De zwakte voor stemagenten is streaming. Native transcriptie is batch-first, en realtime betekent overstappen naar de aparte Realtime API, waar mijn eerste transcript-chunk tussen 500 en 1500ms arriveerde. Voor opgenomen meertalige content binnen een OpenAI-stack is het een makkelijke keuze.
Pluspunten
Minpunten
Prijs $0,006 per minuut voor gpt-4o-transcribe, $0,003 voor mini, en ongeveer $0,017 per minuut voor realtime transcriptie.
Wat doet het? Een streaming-first speech-to-text-model dat transcripten met lage latency levert over meer dan 90 talen.
Voor wie is het? Bouwers die snelle, nauwkeurige transcriptie in veel talen nodig hebben voor agenten en live captions.
| Categorie | Score |
|---|---|
| Transcriptienauwkeurigheid | 8,8/10 |
| Realtime latency | 9,0/10 |
| Meertalige ondersteuning | 9,5/10 |
| Productiegereedheid | 8,0/10 |
| Gemak van installatie | 8,5/10 |
| Totaal | 8,6/10 |
Ik streamde live audio naar Scribe v2 Realtime en zag eerste partials rond de 150ms terugkomen, het snelste eerste-token-resultaat in de groep, met predictieve transcriptie die de volgende woorden anticipeerde.
Over een mix van Engelse, Spaanse en Hindi-clips hield het de nauwkeurigheid vast waar zwakkere modellen afdreven, en het detecteerde automatisch taalwisselingen binnen één bestand zonder handmatige segmentatie.
Sprekerlabeling maakte indruk aan tafels met meerdere partijen, waar het beurten netjes taggde en entiteiten van tijdstempels voorzag voor redactie. Keyterm-prompting liet me tot 1000 zinnen richting productnamen en medicatie bijsturen, wat de fouten op merkgebonden termen verminderde.
De beperking is de volwassenheid als ruggengraat voor een callcenter. Realtime-diarisatie op niet-Engelse audio is nog ruw, en de productietooling is jonger dan die van Deepgram. Voor realtime meertalige transcriptie waar snelheid en taalbreedte allebei belangrijk zijn, is het de sterkste specialist.
Pluspunten
Minpunten
Prijs Op gebruik gebaseerd per audiominuut, met Scribe v2 rond de $0,22 per 1.000 tokens op instaptiers na recente verlagingen, plus een gratis tier om te beginnen.
Gepubliceerde WER komt meestal uit schone opnames, en een model op 5% in een benchmark kan 15-20% raken op een luidruchtig gesprek. Ik scoorde elk model op mijn eigen 8 kHz-gespreksset en checkte dit tegen onafhankelijke benchmarks, zodat de rangschikking de productierealiteit weerspiegelt, niet een leaderboard.
Voor transcriptie is time-to-final het getal. Voor een stemagent draait het om de volledige round trip van spraak naar gesproken antwoord, want alles boven een seconde voelt als een walkietalkie. Ik woog streaming-latency zwaar voor de conversationele use cases.
Een model dat wint in het Engels kan instorten op gesprekken met accent of gemengde taal. Ik testte Spaans-Engelse en Hindi-audio omdat neurale stem nu de standaard is in klantenservice over de hele spraakherkenningsmarkt, en bellers blijven niet eentalig.
Het diepste criterium was de scope. Een ruw model geeft je tekst en laat de LLM, stem en turn-taking aan jou over. Een platform geeft je een agent. Ik scoorde elke tool tegen de taak waarvoor kopers hem inhuren, en daarom scheidt de rangschikking transcriptieleiders van agentplatforms.
Een model geeft je tekst. Een bedrijf heeft nodig dat het gesprek wordt beantwoord, de vraag wordt opgelost en de afspraak wordt ingepland. De vijf modellen hier zijn het juiste startpunt als transcriptie je product is, en AssemblyAI, Deepgram, OpenAI en ElevenLabs winnen elk een duidelijke baan.
Als je doel een telefoonagent is die hoort, begrijpt en handelt in één loop van ongeveer 600ms, heb je de laag boven het model nodig. Retell AI laat spraakherkenning, je keuze aan LLM, een ultrarealistische stem en eigen turn-taking als één productie-agent draaien, zonder platformkosten en met $10 aan gratis tegoed.
Begin vandaag gratis met het bouwen van je eerste AI-stemagent.
Het kiezen van een speech-to-text-model in 2026 komt neer op één eerlijke vraag: wat gebeurt er met de tekst nadat het model die produceert? Als iemand het transcript later leest, bepalen nauwkeurigheid en prijs de winnaar, en de async-leiders zijn moeilijk te verslaan. Als een machine een beller moet horen, de intentie moet begrijpen en moet reageren voordat de stilte ongemakkelijk wordt, dan is het model slechts de eerste schakel in een langere keten, en telt de latency over de hele loop meer dan welke enkele benchmark ook.
De teams die betrouwbare voice-producten leveren, maken dat onderscheid vroeg. Ze testen op de audio die hun gebruikers in het wild produceren, luidruchtige lijnen en namen met accent inbegrepen, in plaats van op schone studiosamples. Ze meten de volledige round trip, niet het partiΓ«le transcript. En ze beslissen vooraf of ze een component of een uitkomst kopen. Krijg die beslissing goed en de shortlist versmalt zichzelf. Het moeilijke deel was nooit het model. Het was weten voor welke taak je het inhuurde.
Welk speech-to-text-model heeft de laagste word error rate in 2026?
AssemblyAI Universal-3 Pro leidt op nauwkeurigheid, met een gerapporteerde gemiddelde WER van 5,6% en de laagste fouten op mijn luidruchtige gespreksset met 4,7%. Deepgram Nova-3 volgt met 5,26% op zijn eigen praktijkset terwijl het woorden veel sneller teruggeeft.
Heb ik een speech-to-text-model of een volledig stemagentplatform nodig?
Als je alleen transcripten van opgenomen bestanden nodig hebt, is een ruw model goedkoper en eenvoudiger. Als je een systeem nodig hebt dat een beller hoort en in realtime reageert, heb je de laag boven het model nodig, en daarom draait een AI-IVR-vervanging STT, een LLM, een stem en turn-taking samen.
Welk speech-to-text-model is het snelst voor live stemagenten?
ElevenLabs Scribe v2 Realtime gaf eerste partials rond de 150ms terug in mijn test, en Deepgram Nova-3 bleef onder 300ms time-to-final. Voor de volledige horen-beslissen-reageren-loop mat Retell ongeveer 600ms end to end, aangezien dat getal de LLM en het gesproken antwoord omvat, niet alleen transcriptie.
Hoeveel kosten speech-to-text-modellen per minuut op schaal?
Deepgram batch draait $0,0043 per minuut, OpenAI gpt-4o-transcribe is $0,006, en AssemblyAI async is $0,21 per uur. Een volledige agent-minuut die STT, LLM, stem en telefonie bundelt, is een andere eenheid, geprijsd rond de $0,07 per minuut.
Kunnen deze speech-to-text-modellen meertalige gesprekken en gesprekken met accent aan?
OpenAI dekt meer dan 99 talen en ElevenLabs dekt meer dan 90, waarmee ze de breedste zijn. AssemblyAI handelt code-switching over zes kerntalen af, en de nauwkeurigheid op audio met accent daalt nog steeds enkele punten voor elk model, dus test op je eigen bellers.
Zijn speech-to-text-modellen HIPAA-compliant voor gesprekken in de zorg?
De meeste koplopers bieden HIPAA-dekking onder een ondertekende BAA, waaronder AssemblyAI, Deepgram, ElevenLabs en Retell, waarvan de laatste ook SOC 2 Type II en GDPR draagt. Bevestig dat de BAA is uitgevoerd voordat je beschermde gezondheidsinformatie verstuurt, en controleer of redactie is inbegrepen of apart wordt gefactureerd. Setup-details voor ontwikkelaars staan in de documentatie.
Wat gebeurt er als een speech-to-text-model een cruciaal woord verkeerd verstaat?
In een transcriptie-only-stack stroomt de fout stilletjes stroomafwaarts en corrumpeert die het record. In een agent kan herstellogica een gespeld nummer opnieuw bevestigen of een warme doorverbinding activeren, en daarom ontwerpen productie-voiceteams voor misherkenning in plaats van aan te nemen dat het model altijd gelijk heeft.
See how much your business could save by switching to AI-powered voice agents.
Total Human Agent Cost
AI Agent Cost
Estimated Savings
Een demodemonummer van Retell Clinic Office

Start building smarter conversations today.




