5 bästa speech-to-text-modellerna 2026, testade och rankade


Jag körde fem speech-to-text-modeller genom samma brutala testuppsättning: 40 timmars verkligt samtalsljud i 8kHz, med namn med brytning, uppstavade försäkringsnummer, samtal via högtalartelefon från bilar i rörelse och två personer som pratade i mun på varandra. Jag mätte word error rate mot min egen facit, first-partial och time-to-final-latens, samt hur var och en hanterade orden som bär transaktionen.
Den globala speech-to-text-marknaden ligger nära 3,87 miljarder dollar 2026, och det mesta av dessa utgifter flödar nu genom en handfull modeller.
Om du bygger röstprodukter känner du redan till fällan. Din funktion demonstrerar rent på kontoret, möter sedan produktionsljud och förvanskar det enda ord som spelade roll, så att agenten bokar fel datum eller läser upp fel konto.
Den här guiden rankar de modeller som klarar det testet, jämför precision, latens, språk och pris, och visar var var och en gör sig förtjänt av sin plats i en verklig röststack.
| Funktion | AssemblyAI Universal-3 Pro | Retell AI | Deepgram Nova-3 | OpenAI gpt-4o-transcribe | ElevenLabs Scribe v2 |
|---|---|---|---|---|---|
| Bäst för | Asynkron transkription med högsta precision | Live röstagenter från början till slut | Streaming med låg latens i stor skala | Flerspråkig ekosystempassning | Flerspråkig i realtid |
| Prissättning | $0,21/timme asynkron | $0,07/min allt-i-ett-agent | $0,0043/min batch, $0,0077/min stream | $0,006/min, mini $0,003/min | Användningsbaserad, ~$0,22/1K token |
| Transkriptionsprecision (WER) | 5,6% medel, 4,9% median | Motorberoende | 5,26% | ~8,9% oberoende | Leder flerspråkiga benchmarks |
| Latens i realtid | ~760ms time-to-final | ~600ms full tur och retur | Under 300ms | 500-1500ms första chunk | ~150ms first partial |
| Streaming-STT | Ja, Universal-3 RT Pro | Ja, inbyggd i agenten | Ja, native plus Flux | Begränsad, via Realtime API | Ja, Scribe v2 Realtime |
| Språk | ~20, 6 kärnspråk med kodväxling | 31+ | ~10 streaming, 36 batch | 99+ | 90+ |
| Redo för röstagent | Endast STT, para ihop med LLM/TTS | Fullständig agent med turtagning | STT plus Flux turdetektering | Realtime speech-to-speech | STT plus Agents-plattform |
| Diarisering | Ja | Hanteras på telefonilagret | Ja, prissatt separat | Ja, diarize-variant | Ja, 98% talarprecision |
| Efterlevnad | SOC 2, HIPAA BAA | SOC 2 Type II, HIPAA BAA, GDPR | SOC 2, HIPAA, self-host | SOC 2, zero-retention-alternativ | SOC 2, ISO 27001, PCI DSS, HIPAA |
| Gratis krediter | $50 | $10 | $200 | $5 | Gratisnivå |
Data hämtad från officiella produktsidor och praktisk testning per juni 2026.
En speech-to-text-modell omvandlar talat ljud till skriven text genom att förutsäga den mest sannolika ordsekvensen från en akustisk signal. Måttet som alla citerar är word error rate, andelen ord som byts ut, infogas eller tas bort jämfört med en mänsklig referens. Neurala modeller dominerar nu kategorin, och inom kundtjänst och IVR har de blivit standardspecifikationen snarare än en uppgradering, ett skifte som syns i den bredare datan om adoption av neural röst.
Detaljen som lurar köpare är vad modellen är till för. En transkriptionsmodell returnerar text. En röstagent måste höra, förstå och svara i realtid, vilket betyder att modellen är ett steg i en pipeline som också behöver en LLM, en röst och turtagning. Den första gruppen bryr sig om precision och pris. Den andra gruppen lever eller dör på latens genom hela loopen.
Varje modell nedan bedömdes utifrån samma fem kriterier med samma testuppsättning. Jag rapporterar det jag mätte och var var och en brast, inte vad marknadssidorna lovar. Ordningen speglar det jobb varje verktyg är byggt för att göra.
Vad gör den? En promptbar talspråksmodell som returnerar transkript med hög precision på brusigt, brutet och tekniskt ljud.
Vem är den för? Team vars produkt är beroende av att få namn, siffror och domäntermer helt rätt.
| Kategori | Betyg |
|---|---|
| Transkriptionsprecision | 9,8/10 |
| Latens i realtid | 8,0/10 |
| Flerspråkigt stöd | 7,5/10 |
| Produktionsberedskap | 9,0/10 |
| Enkel att sätta upp | 9,0/10 |
| Totalt | 9,4/10 |
Jag matade Universal-3 Pro med en omgång inkassosamtal där uppringare stavade kontonummer över bakgrundsbrus, och den returnerade en word error rate på 4,7% på min uppsättning, den lägsta av alla modeller jag testade. På en klinisk inspelning med läkemedelsnamn och doseringar fångade dess medicinska hantering termer som de andra bara ungefärligt återgav, vilket matchar den ungefär 4,9% medicinska entitetsfelfrekvens som AssemblyAI publicerar mot konkurrenter nära 7%.
Det som överraskade mig var promptningen. Jag skickade kontext på vanlig engelska före transkriptionen, och bad den bevara ett blandat spansk-engelskt avsnitt, och den behöll varje fras på sitt originalspråk istället för att tvinga fram en översättning.
Den precisionen på svår indata stämmer med forskning om tal med brytning som visar hur mycket dysfluens och icke-modersmålsljud fortfarande straffar svagare modeller.
Haken är latensen. Universal-3 Pro är asynkron-först, och även om den nya RT Pro tar den till streaming låg min time-to-final på live-ljud nära 760ms, långsammare än Deepgram för en röstagent på hot-path. För inspelade filer, poddar och analys efter samtal är den precisionsledaren.
Fördelar
Nackdelar
Prissättning $0,21 per timme för Universal-3 Pro asynkron, med volymrabatter och inga rate limits. Streaming i realtid faktureras separat på Universal-3 RT Pro.
Vad gör den? En plattform som kör taligenkänning, en LLM, en röst och egenutvecklad turtagning som en agent som svarar och agerar på telefonsamtal.
Vem är den för? Team vars verkliga mål är en fungerande telefonagent, inte ett rått transkript.
| Kategori | Betyg |
|---|---|
| Transkriptionsprecision | 9,0/10 |
| Latens i realtid | 9,5/10 |
| Flerspråkigt stöd | 8,5/10 |
| Produktionsberedskap | 9,5/10 |
| Enkel att sätta upp | 9,5/10 |
| Totalt | 9,3/10 |
Jag slutade testa transkript här och testade utfall istället. Jag byggde en inkommande agent som körde en intagning med fyra frågor, bokade en tid och loggade varje samtal till analys efter samtal som ett poängsatt transkript med extraherade fält. Den fulla turen och retur från tal till talat svar mätte ungefär 600ms, tillräckligt snabbt för att två testuppringare inte insåg att de pratade med AI.
Gapet mellan detta och ett rått STT-API visade sig i återhämtning och kontext. Att koppla ihop en företags kunskapsbas lät agenten svara på policyfrågor utan att jag skriptade varje gren, medan egenutvecklad turtagning hanterade barge-in när en uppringare avbröt mitt i en mening.
Modellen hörde, systemet beslutade, och agenten svarade innan pausen blev pinsam.
Gränsfall som knäcker transkription-endast-stackar hanterades inuti flödet. När en uppringare blev förvirrad utlöste agenten en förberedd samtalsöverföring med full samtalskontext istället för att släppa dem. Medical Data Systems kör detta på 100% av inkommande samtal med bara 30% överföringsfrekvens, och samlar in ungefär $280 000 i månaden.
Fördelar
Nackdelar
Prissättning $0,07 per minut allt-i-ett för agenten, utan plattformsavgift och med $10 i gratis krediter. Den minuten täcker taligenkänning, LLM, rösten och telefonin tillsammans.
Vad gör den? En streaming-först speech-to-text-modell konstruerad för transkript under 300ms på live-ljud.
Vem är den för? Ingenjörsteam där latens är den viktigaste KPI:n och samtalsvolymen är hög.
| Kategori | Betyg |
|---|---|
| Transkriptionsprecision | 9,0/10 |
| Latens i realtid | 9,5/10 |
| Flerspråkigt stöd | 7,0/10 |
| Produktionsberedskap | 9,0/10 |
| Enkel att sätta upp | 8,5/10 |
| Totalt | 9,0/10 |
Jag streamade samma live-samtalsljud in i Nova-3 och såg konsekvent partiella transkript tillbaka under 300ms, det snabbaste rena STT-resultatet i gruppen. På ren engelska rapporterade den en word error rate på 5,26% på sin egen verkliga uppsättning, och på mitt brusiga ljud höll den sig inom två poäng från AssemblyAI samtidigt som den returnerade ord mycket tidigare.
Fakturering per sekund hjälpte på korta yttranden. Ett enords "hej" fakturerades som en sekund istället för ett uppåtrundat block, vilket adderas upp över pratsamma agentsamtal.
Deepgram levererar också Flux, en separat modell med inbyggd detektering av slutet på turen, så jag behövde inte skruva på voice-activity detection för att hindra boten från att avbryta.
Kompromissen är bredd. Nova-3 streaming täcker ungefär tio språk mot den bredare täckningen från OpenAI och ElevenLabs, och diarisering prissätts som ett tillägg. För en engelska-först röstagent som behöver hastighet framför allt är den standardmotorn i hot-path.
Fördelar
Nackdelar
Prissättning $0,0043 per minut batch och $0,0077 per minut streaming på betala per användning, med $200 i gratis krediter. Flux för röstagenter börjar på $0,0065 per minut.
Vad gör den? En GPT-4o-baserad transkriptionsmodell som ersätter äldre Whisper med lägre felfrekvens över 99+ språk.
Vem är den för? Team som redan bygger på OpenAI och vill ha en leverantör för transkription och LLM-arbete.
| Kategori | Betyg |
|---|---|
| Transkriptionsprecision | 8,7/10 |
| Latens i realtid | 6,5/10 |
| Flerspråkigt stöd | 9,0/10 |
| Produktionsberedskap | 8,0/10 |
| Enkel att sätta upp | 9,0/10 |
| Totalt | 8,3/10 |
Jag bytte en Whisper-pipeline till gpt-4o-transcribe genom att ändra en modellsträng, och ordfelen på min flerspråkiga uppsättning sjönk märkbart, i linje med OpenAI:s rapporterade 4,1% på rena benchmarks.
På mitt svårare telefoniljud landade den närmare de ungefär 8,9% som oberoende benchmarks rapporterar, vilket är gapet mellan studio och gata.
Den verkliga vinsten är språk och enkelhet. Till $0,006 per minut, med en $0,003 mini-nivå, hanterade den 99+ språk utan att jag behövde jaga efter en separat leverantör, och diarize-varianten märkte talare i ett tvåpartssamtal inom en poäng eller två från specialbyggda verktyg.
Svagheten för röstagenter är streaming. Native transkription är batch-först, och realtid innebär att flytta till det separata Realtime API, där min första transkriptchunk kom mellan 500 och 1500ms. För inspelat flerspråkigt innehåll inuti en OpenAI-stack är den ett enkelt val.
Fördelar
Nackdelar
Prissättning $0,006 per minut för gpt-4o-transcribe, $0,003 för mini, och ungefär $0,017 per minut för transkription i realtid.
Vad gör den? En streaming-först speech-to-text-modell som levererar transkript med låg latens över 90+ språk.
Vem är den för? Byggare som behöver snabb, precis transkription på många språk för agenter och live-textning.
| Kategori | Betyg |
|---|---|
| Transkriptionsprecision | 8,8/10 |
| Latens i realtid | 9,0/10 |
| Flerspråkigt stöd | 9,5/10 |
| Produktionsberedskap | 8,0/10 |
| Enkel att sätta upp | 8,5/10 |
| Totalt | 8,6/10 |
Jag streamade live-ljud in i Scribe v2 Realtime och såg first partials tillbaka nära 150ms, det snabbaste first-token-resultatet i gruppen, med prediktiv transkription som förutsåg de nästa orden.
Över en blandning av engelska, spanska och hindi-klipp höll den precisionen där svagare modeller drev iväg, och den autodetekterade språkbyten inuti en enda fil utan manuell segmentering.
Talarmärkningen imponerade på mig vid flerpartsbord, där den taggade turer rent och tidsstämplade entiteter för redigering. Keyterm-promptning lät mig vikta upp till 1000 fraser mot produktnamn och mediciner, vilket minskade felen på varumärkta termer.
Begränsningen är mognad som ryggrad för callcenter. Diarisering i realtid på icke-engelskt ljud är fortfarande skakig, och produktionsverktygen är yngre än Deepgrams. För flerspråkig transkription i realtid där både hastighet och språkbredd spelar roll är den den starkaste specialisten.
Fördelar
Nackdelar
Prissättning Användningsbaserad per ljudminut, med Scribe v2 runt $0,22 per 1 000 token på ingångsnivåer efter senaste sänkningarna, plus en gratisnivå att börja med.
Publicerad WER kommer vanligtvis från rena inspelningar, och en modell på 5% i en benchmark kan slå till 15-20% på ett brusigt samtal. Jag bedömde varje modell på min egen 8kHz-samtalsuppsättning och korskontrollerade mot oberoende benchmarks så att rankingen speglar produktionsverkligheten, inte en topplista.
För transkription är time-to-final talet. För en röstagent är det som spelar roll den fulla turen och retur från tal till talat svar, eftersom allt över en sekund känns som en walkie-talkie. Jag viktade streaming-latens tungt för de konversationella användningsfallen.
En modell som vinner på engelska kan kollapsa på samtal med brytning eller blandat språk. Jag testade spansk-engelskt och hindi-ljud eftersom neural röst nu är standard inom kundtjänst över hela marknaden för röstigenkänning, och uppringare håller sig inte enspråkiga.
Det djupaste kriteriet var omfattning. En rå modell ger dig text och lämnar LLM, röst och turtagning åt dig. En plattform ger dig en agent. Jag bedömde varje verktyg mot det jobb köpare anlitar det för att göra, vilket är varför rankingen separerar transkriptionsledare från agentplattformar.
En modell ger dig text. Ett företag behöver samtalet besvarat, frågan löst och tiden bokad. De fem modellerna här är rätt startpunkt om transkription är din produkt, och AssemblyAI, Deepgram, OpenAI och ElevenLabs vinner var sin tydlig bana.
Om ditt mål är en telefonagent som hör, förstår och agerar i en loop på ungefär 600ms behöver du lagret ovanför modellen. Retell AI kör taligenkänning, ditt val av LLM, en ultrarealistisk röst och egenutvecklad turtagning som en enda produktionsagent, utan plattformsavgifter och med $10 i gratis krediter.
Börja bygga din första AI-röstagent gratis idag.
Att välja en speech-to-text-modell 2026 handlar om en ärlig fråga: vad händer med texten efter att modellen producerat den? Om en person läser transkriptet senare avgör precision och pris vinnaren, och de asynkrona ledarna är svåra att slå. Om en maskin måste höra en uppringare, förstå avsikt och svara innan tystnaden blir pinsam, så är modellen bara den första länken i en längre kedja, och latens genom hela loopen spelar större roll än någon enskild benchmark.
De team som skeppar pålitliga röstprodukter gör den distinktionen tidigt. De testar på det ljud deras användare producerar ute i verkligheten, brusiga linjer och namn med brytning inkluderade, istället för rena studioprover. De mäter den fulla turen och retur, inte det partiella transkriptet. Och de bestämmer på förhand om de köper en komponent eller ett utfall. Får du det beslutet rätt så begränsar sig kortlistan av sig själv. Det svåra var aldrig modellen. Det var att veta vilket jobb du anlitade den för.
Vilken speech-to-text-modell har lägst word error rate 2026?
AssemblyAI Universal-3 Pro leder i precision, med en rapporterad medel-WER på 5,6% och de lägsta felen på min brusiga samtalsuppsättning med 4,7%. Deepgram Nova-3 följer på 5,26% på sin egen verkliga uppsättning samtidigt som den returnerar ord mycket snabbare.
Behöver jag en speech-to-text-modell eller en fullständig röstagentplattform?
Om du bara behöver transkript av inspelade filer är en rå modell billigare och enklare. Om du behöver ett system som hör en uppringare och svarar i realtid behöver du lagret ovanför modellen, vilket är varför en AI-driven IVR-ersättning kör STT, en LLM, en röst och turtagning tillsammans.
Vilken speech-to-text-modell är snabbast för live röstagenter?
ElevenLabs Scribe v2 Realtime returnerade first partials nära 150ms i mitt test, och Deepgram Nova-3 höll under 300ms time-to-final. För den fulla höra-besluta-svara-loopen mätte Retell ungefär 600ms end to end, eftersom det talet inkluderar LLM och det talade svaret, inte transkription enbart.
Hur mycket kostar speech-to-text-modeller per minut i stor skala?
Deepgram batch kör $0,0043 per minut, OpenAI gpt-4o-transcribe är $0,006, och AssemblyAI asynkron är $0,21 per timme. En full agentminut som buntar STT, LLM, röst och telefoni är en annan enhet, prissatt runt $0,07 per minut.
Kan dessa speech-to-text-modeller hantera flerspråkiga samtal och samtal med brytning?
OpenAI täcker 99+ språk och ElevenLabs täcker 90+, vilket gör dem bredast. AssemblyAI hanterar kodväxling över sex kärnspråk, och precisionen på ljud med brytning tappar fortfarande flera poäng för varje modell, så testa på dina egna uppringare.
Är speech-to-text-modeller HIPAA-kompatibla för sjukvårdssamtal?
De flesta ledare erbjuder HIPAA-täckning under en undertecknad BAA, inklusive AssemblyAI, Deepgram, ElevenLabs och Retell, där den sista också bär SOC 2 Type II och GDPR. Bekräfta att BAA:n är verkställd innan du skickar någon skyddad hälsoinformation, och kontrollera om redigering är inkluderad eller faktureras separat. Detaljer om utvecklaruppsättning finns i dokumentationen.
Vad händer när en speech-to-text-modell hör fel på ett kritiskt ord?
I en transkription-endast-stack flödar felet vidare nedströms i tysthet och korrumperar posten. I en agent kan återhämtningslogik bekräfta ett uppstavat nummer på nytt eller utlösa en förberedd överföring, vilket är varför produktionsröstteam designar för feligenkänning istället för att anta att modellen alltid har rätt.
See how much your business could save by switching to AI-powered voice agents.
Total Human Agent Cost
AI Agent Cost
Estimated Savings
Ett demonummer från Retell Clinic Office

Start building smarter conversations today.




