5 bedste speech-to-text-modeller i 2026, testet og rangeret


Jeg kørte fem speech-to-text-modeller gennem det samme benhårde testsæt: 40 timers rigtig opkaldslyd ved 8 kHz, herunder navne med accent, stavede policenumre, håndfriopkald fra kørende biler og to personer, der talte i munden på hinanden. Jeg målte word error rate mod mit eget facit, first-partial og time-to-final-latens, og hvordan hver enkelt håndterede de ord, der bærer transaktionen.
Det globale speech-to-text-marked ligger nær 3,87 milliarder dollar i 2026, og det meste af de penge flyder nu gennem en håndfuld modeller.
Hvis du bygger stemmeprodukter, kender du allerede fælden. Din feature demonstrerer rent på kontoret og møder så produktionslyd og forvansker det ene ord, der betød noget, så agenten booker den forkerte dato eller læser den forkerte konto op.
Denne guide rangerer de modeller, der overlever den test, sammenligner nøjagtighed, latens, sprog og pris, og viser hvor hver enkelt fortjener sin plads i en rigtig stemme-stack.
| Feature | AssemblyAI Universal-3 Pro | Retell AI | Deepgram Nova-3 | OpenAI gpt-4o-transcribe | ElevenLabs Scribe v2 |
|---|---|---|---|---|---|
| Bedst til | Async transskription med højeste nøjagtighed | Live stemmeagenter fra ende til ende | Streaming med lav latens i stor skala | Flersproget økosystem-tilpasning | Flersproget i realtid |
| Priser | $0.21/time async | $0.07/min alt inkl. agent | $0.0043/min batch, $0.0077/min stream | $0.006/min, mini $0.003/min | Forbrugsbaseret, ~$0.22/1K tokens |
| Transskriptionsnøjagtighed (WER) | 5,6 % gennemsnit, 4,9 % median | Engine-afhængig | 5,26 % | ~8,9 % uafhængigt | Fører flersprogede benchmarks |
| Latens i realtid | ~760 ms time-to-final | ~600 ms fuld tur-retur | Under 300 ms | 500-1500 ms første chunk | ~150 ms first partial |
| Streaming-STT | Ja, Universal-3 RT Pro | Ja, indbygget i agenten | Ja, native plus Flux | Begrænset, via Realtime API | Ja, Scribe v2 Realtime |
| Sprog | ~20, 6 core code-switching | 31+ | ~10 streaming, 36 batch | 99+ | 90+ |
| Klar til stemmeagent | Kun STT, kombinér med LLM/TTS | Fuld agent med turtagning | STT plus Flux-turdetektion | Realtime speech-to-speech | STT plus Agents-platform |
| Diarisering | Ja | Håndteret i telefonilaget | Ja, prissat separat | Ja, diarize-variant | Ja, 98 % talernøjagtighed |
| Compliance | SOC 2, HIPAA BAA | SOC 2 Type II, HIPAA BAA, GDPR | SOC 2, HIPAA, self-host | SOC 2, zero-retention-mulighed | SOC 2, ISO 27001, PCI DSS, HIPAA |
| Gratis kredit | $50 | $10 | $200 | $5 | Gratis niveau |
Data hentet fra officielle produktsider og praktisk test pr. juni 2026.
En speech-to-text-model konverterer talt lyd til skreven tekst ved at forudsige den mest sandsynlige ordsekvens ud fra et akustisk signal. Den måling, alle citerer, er word error rate, procentdelen af ord, der er erstattet, indsat eller slettet i forhold til en menneskelig reference. Neurale modeller dominerer nu kategorien, og inden for kundeservice og IVR er de blevet standardspecifikationen frem for en opgradering, et skift der er synligt på tværs af de bredere data om udbredelse af neural stemme.
Den detalje, der spænder ben for købere, er, hvad modellen er til for. En transskriptionsmodel returnerer tekst. En stemmeagent skal høre, forstå og svare i realtid, hvilket betyder, at modellen er ét trin i en pipeline, der også har brug for en LLM, en stemme og turtagning. Den første gruppe går op i nøjagtighed og pris. Den anden gruppe lever eller dør på latens gennem hele loopet.
Hver model nedenfor blev scoret på de samme fem kriterier med det samme testsæt. Jeg rapporterer, hvad jeg målte, og hvor hver enkelt brød sammen, ikke hvad marketingsiderne lover. Rækkefølgen afspejler det job, hvert værktøj er bygget til at udføre.
Hvad gør den? En promptbar sprogmodel til tale, der returnerer transskriptioner med høj nøjagtighed på støjende, accentpræget og teknisk lyd.
Hvem er den til? Teams, hvis produkt afhænger af at få navne, tal og domænetermer helt rigtige.
| Kategori | Score |
|---|---|
| Transskriptionsnøjagtighed | 9,8/10 |
| Latens i realtid | 8,0/10 |
| Flersproget support | 7,5/10 |
| Produktionsparathed | 9,0/10 |
| Nem opsætning | 9,0/10 |
| Samlet | 9,4/10 |
Jeg fodrede Universal-3 Pro med en batch af inkassoopkald, hvor personer stavede kontonumre over baggrundsstøj, og den returnerede en word error rate på 4,7 % på mit sæt, den laveste af alle de modeller, jeg testede. På en klinisk optagelse med lægemiddelnavne og doser fangede dens medicinske håndtering termer, som de andre kun tilnærmede, hvilket matcher den fejlrate for medicinske entiteter på cirka 4,9 %, som AssemblyAI offentliggør mod konkurrenter nær 7 %.
Det, der overraskede mig, var promptingen. Jeg gav almindelig engelsk kontekst før transskriptionen og bad den om at bevare et blandet spansk-engelsk afsnit, og den holdt hver sætning på dens oprindelige sprog i stedet for at tvinge en oversættelse frem.
Den nøjagtighed på svært input flugter med forskning i accentpræget tale, der viser, hvor meget disfluens og ikke-modersmålslyd stadig straffer svagere modeller.
Haken er latens. Universal-3 Pro er async-first, og selvom den nye RT Pro bringer den til streaming, lå min time-to-final på live-lyd nær 760 ms, langsommere end Deepgram til en stemmeagent i hot-path. Til optagede filer, podcasts og analyse efter opkald er den nøjagtighedsføreren.
Fordele
Ulemper
Priser $0.21 pr. time for Universal-3 Pro async, med mængderabatter og ingen rate limits. Streaming i realtid faktureres separat på Universal-3 RT Pro.
Hvad gør den? En platform, der kører talegenkendelse, en LLM, en stemme og proprietær turtagning som én agent, der besvarer og handler på opkald.
Hvem er den til? Teams, hvis reelle mål er en fungerende telefonagent, ikke en rå transskription.
| Kategori | Score |
|---|---|
| Transskriptionsnøjagtighed | 9,0/10 |
| Latens i realtid | 9,5/10 |
| Flersproget support | 8,5/10 |
| Produktionsparathed | 9,5/10 |
| Nem opsætning | 9,5/10 |
| Samlet | 9,3/10 |
Jeg holdt op med at teste transskriptioner her og testede resultater. Jeg byggede en indgående agent, der kørte en intake med fire spørgsmål, bookede en tid og loggede hvert opkald til analyse efter opkald som en scoret transskription med udtrukne felter. Den fulde tur-retur fra tale til talt svar målte cirka 600 ms, hurtigt nok til at to testpersoner ikke opdagede, at de talte med AI.
Forskellen mellem dette og en rå STT-API viste sig i genopretning og kontekst. At forbinde en virksomheds vidensbase lod agenten besvare policespørgsmål uden at jeg scriptede hver forgrening, mens proprietær turtagning håndterede barge-in, når en person afbrød midt i en sætning.
Modellen hørte, systemet besluttede, og agenten svarede, før pausen blev akavet.
Edge cases, der bryder transskriptions-only-stacks, blev håndteret inde i flowet. Da en person blev forvirret, udløste agenten en assisteret viderestilling af opkald med fuld samtalekontekst i stedet for at tabe dem. Medical Data Systems kører dette på 100 % af indgående opkald med kun en viderestillingsrate på 30 % og indkasserer cirka $280.000 om måneden.
Fordele
Ulemper
Priser $0.07 pr. minut alt inkl. for agenten, uden platformsgebyr og med $10 i gratis kredit. Det minut dækker talegenkendelse, LLM'en, stemmen og telefoni tilsammen.
Hvad gør den? En streaming-first speech-to-text-model bygget til transskriptioner under 300 ms på live-lyd.
Hvem er den til? Engineering-teams, hvor latens er den vigtigste KPI, og opkaldsvolumen er højt.
| Kategori | Score |
|---|---|
| Transskriptionsnøjagtighed | 9,0/10 |
| Latens i realtid | 9,5/10 |
| Flersproget support | 7,0/10 |
| Produktionsparathed | 9,0/10 |
| Nem opsætning | 8,5/10 |
| Samlet | 9,0/10 |
Jeg streamede den samme live opkaldslyd ind i Nova-3 og så konsekvent partielle transskriptioner tilbage under 300 ms, det hurtigste rene STT-resultat i gruppen. På rent engelsk rapporterede den en word error rate på 5,26 % på sit eget virkelighedssæt, og på min støjende lyd holdt den sig inden for to point af AssemblyAI, mens den returnerede ord langt hurtigere.
Fakturering pr. sekund hjalp på korte ytringer. Et enkelt ord som "hallo" blev faktureret som ét sekund i stedet for en oprundet blok, hvilket lægger op over snakkesalige agentopkald.
Deepgram leverer også Flux, en separat model med indbygget detektion af slutning på tur, så jeg ikke behøvede at bolte voice-activity-detektion på for at stoppe botten fra at afbryde.
Afvejningen er bredde. Nova-3 streaming dækker cirka ti sprog mod den bredere dækning fra OpenAI og ElevenLabs, og diarisering er prissat som et tilkøb. Til en engelsk-first stemmeagent, der har brug for hastighed frem for alt, er den standard-enginen i hot-path.
Fordele
Ulemper
Priser $0.0043 pr. minut batch og $0.0077 pr. minut streaming på betal efter forbrug, med $200 i gratis kredit. Flux til stemmeagenter starter ved $0.0065 pr. minut.
Hvad gør den? En GPT-4o-baseret transskriptionsmodel, der erstatter den ældre Whisper med lavere fejlrater på tværs af over 99 sprog.
Hvem er den til? Teams, der allerede bygger på OpenAI og vil have én leverandør til transskription og LLM-arbejde.
| Kategori | Score |
|---|---|
| Transskriptionsnøjagtighed | 8,7/10 |
| Latens i realtid | 6,5/10 |
| Flersproget support | 9,0/10 |
| Produktionsparathed | 8,0/10 |
| Nem opsætning | 9,0/10 |
| Samlet | 8,3/10 |
Jeg skiftede en Whisper-pipeline til gpt-4o-transcribe ved at ændre én model-streng, og ordfejl på mit flersprogede sæt faldt mærkbart, i tråd med de 4,1 %, som OpenAI rapporterer på rene benchmarks.
På min sværere telefonilyd landede den tættere på de cirka 8,9 %, som uafhængige benchmarks rapporterer, hvilket er forskellen mellem studie og gade.
Den reelle sejr er sprog og enkelhed. Til $0.006 pr. minut, med et mini-niveau på $0.003, håndterede den over 99 sprog uden at jeg jagtede en separat udbyder, og diarize-varianten mærkede talere i et to-parts-opkald inden for et point eller to af formålsbyggede værktøjer.
Svagheden for stemmeagenter er streaming. Native transskription er batch-first, og realtid betyder at flytte til den separate Realtime API, hvor min første transskriptions-chunk ankom mellem 500 og 1500 ms. Til optaget flersproget indhold inde i en OpenAI-stack er den et nemt valg.
Fordele
Ulemper
Priser $0.006 pr. minut for gpt-4o-transcribe, $0.003 for mini og cirka $0.017 pr. minut for realtidstransskription.
Hvad gør den? En streaming-first speech-to-text-model, der leverer transskriptioner med lav latens på tværs af over 90 sprog.
Hvem er den til? Byggere, der har brug for hurtig, nøjagtig transskription på mange sprog til agenter og live-undertekster.
| Kategori | Score |
|---|---|
| Transskriptionsnøjagtighed | 8,8/10 |
| Latens i realtid | 9,0/10 |
| Flersproget support | 9,5/10 |
| Produktionsparathed | 8,0/10 |
| Nem opsætning | 8,5/10 |
| Samlet | 8,6/10 |
Jeg streamede live-lyd ind i Scribe v2 Realtime og så first partials tilbage nær 150 ms, det hurtigste first-token-resultat i gruppen, med prædiktiv transskription, der foregreb de næste ord.
På tværs af en blanding af engelske, spanske og hindi-klip holdt den nøjagtigheden, hvor svagere modeller drev, og den auto-detekterede sprogskift inde i en enkelt fil uden manuel segmentering.
Talermærkning imponerede mig ved borde med flere parter, hvor den mærkede ture rent og satte tidsstempler på entiteter til redaktion. Keyterm-prompting lod mig bias op til 1.000 sætninger mod produktnavne og medicin, hvilket skar fejl på brandede termer.
Begrænsningen er modenhed som rygrad i et callcenter. Diarisering i realtid på ikke-engelsk lyd er stadig grov, og produktionsværktøjer er yngre end Deepgrams. Til flersproget transskription i realtid, hvor både hastighed og sprogbredde betyder noget, er den den stærkeste specialist.
Fordele
Ulemper
Priser Forbrugsbaseret pr. lydminut, med Scribe v2 omkring $0.22 pr. 1.000 tokens på indgangsniveauer efter nylige nedskæringer, plus et gratis niveau til at starte.
Offentliggjort WER kommer normalt fra rene optagelser, og en model på 5 % på et benchmark kan ramme 15-20 % på et støjende opkald. Jeg scorede hver model på mit eget 8 kHz-opkaldssæt og krydstjekkede mod uafhængige benchmarks, så rangeringen afspejler produktionsvirkelighed, ikke et leaderboard.
Til transskription er time-to-final tallet. Til en stemmeagent er det, der betyder noget, den fulde tur-retur fra tale til talt svar, for alt over et sekund føles som en walkie-talkie. Jeg vægtede streaming-latens tungt til de konversationelle use cases.
En model, der vinder på engelsk, kan bryde sammen på accentprægede eller blandede opkald. Jeg testede spansk-engelsk og hindi-lyd, fordi neural stemme nu er standard i kundeservice på tværs af markedet for stemmegenkendelse, og personer forbliver ikke ensprogede.
Det dybeste kriterium var omfang. En rå model giver dig tekst og overlader LLM'en, stemmen og turtagningen til dig. En platform giver dig en agent. Jeg scorede hvert værktøj mod det job, købere ansætter det til, hvilket er grunden til, at rangeringen adskiller transskriptionsførere fra agentplatforme.
En model giver dig tekst. En virksomhed har brug for, at opkaldet besvares, spørgsmålet løses og mødet bookes. De fem modeller her er det rette udgangspunkt, hvis transskription er dit produkt, og AssemblyAI, Deepgram, OpenAI og ElevenLabs vinder hver sin klare bane.
Hvis dit mål er en telefonagent, der hører, forstår og handler i ét cirka 600 ms-loop, har du brug for laget over modellen. Retell AI kører talegenkendelse, dit valg af LLM, en ultrarealistisk stemme og proprietær turtagning som en enkelt produktionsagent, uden platformsgebyrer og med $10 i gratis kredit.
Begynd at bygge din første AI-stemmeagent gratis i dag.
At vælge en speech-to-text-model i 2026 kommer ned til ét ærligt spørgsmål: hvad sker der med teksten, efter modellen har produceret den? Hvis en person læser transskriptionen senere, afgør nøjagtighed og pris vinderen, og async-førerne er svære at slå. Hvis en maskine skal høre en person, forstå intentionen og svare, før stilheden bliver akavet, så er modellen kun det første led i en længere kæde, og latens gennem hele loopet betyder mere end noget enkelt benchmark.
De teams, der leverer pålidelige stemmeprodukter, gør den skelnen tidligt. De tester på den lyd, deres brugere producerer i det fri, støjende linjer og accentprægede navne inkluderet, i stedet for rene studiesamples. De måler den fulde tur-retur, ikke den partielle transskription. Og de beslutter på forhånd, om de køber en komponent eller et resultat. Få den beslutning rigtig, og shortlisten indsnævrer sig selv. Den svære del var aldrig modellen. Det var at vide, hvilket job du ansatte den til.
Hvilken speech-to-text-model har den laveste word error rate i 2026?
AssemblyAI Universal-3 Pro fører nøjagtighed med en gennemsnitlig WER på 5,6 % og de laveste fejl på mit støjende opkaldssæt på 4,7 %. Deepgram Nova-3 følger med 5,26 % på sit eget virkelighedssæt, mens den returnerer ord langt hurtigere.
Har jeg brug for en speech-to-text-model eller en fuld stemmeagent-platform?
Hvis du kun har brug for transskriptioner af optagede filer, er en rå model billigere og enklere. Hvis du har brug for et system, der hører en person og svarer i realtid, har du brug for laget over modellen, hvilket er grunden til, at en AI-drevet IVR-erstatning kører STT, en LLM, en stemme og turtagning sammen.
Hvilken speech-to-text-model er hurtigst til live stemmeagenter?
ElevenLabs Scribe v2 Realtime returnerede first partials nær 150 ms i min test, og Deepgram Nova-3 holdt sig under 300 ms time-to-final. Til det fulde hør-beslut-svar-loop målte Retell cirka 600 ms fra ende til ende, da det tal inkluderer LLM'en og det talte svar, ikke kun transskription.
Hvad koster speech-to-text-modeller pr. minut i stor skala?
Deepgram batch kører $0.0043 pr. minut, OpenAI gpt-4o-transcribe er $0.006, og AssemblyAI async er $0.21 pr. time. Et fuldt agentminut, der bundter STT, LLM, stemme og telefoni, er en anden enhed, prissat omkring $0.07 pr. minut.
Kan disse speech-to-text-modeller håndtere flersprogede og accentprægede opkald?
OpenAI dækker over 99 sprog og ElevenLabs dækker over 90, hvilket gør dem bredest. AssemblyAI håndterer code-switching på tværs af seks core-sprog, og nøjagtigheden på accentpræget lyd falder stadig flere point for hver model, så test på dine egne personer.
Er speech-to-text-modeller HIPAA-compliant til sundhedsopkald?
De fleste førere tilbyder HIPAA-dækning under en underskrevet BAA, herunder AssemblyAI, Deepgram, ElevenLabs og Retell, hvor sidstnævnte også bærer SOC 2 Type II og GDPR. Bekræft, at BAA'en er indgået, før du sender nogen beskyttet sundhedsinformation, og tjek, om redaktion er inkluderet eller faktureret separat. Detaljer om udvikleropsætning findes i dokumentationen.
Hvad sker der, når en speech-to-text-model overhører et kritisk ord?
I en transskriptions-only-stack flyder fejlen tavst nedstrøms og korrumperer posten. I en agent kan genopretningslogik genbekræfte et stavet tal eller udløse en assisteret viderestilling, hvilket er grunden til, at produktionsstemmeteams designer til fejlgenkendelse i stedet for at antage, at modellen altid har ret.
See how much your business could save by switching to AI-powered voice agents.
Total Human Agent Cost
AI Agent Cost
Estimated Savings
Et demonummer fra Retell Clinic Office

Start building smarter conversations today.




