5 beste Speech-to-Text-Modelle 2026, getestet und bewertet


Ich habe fünf Speech-to-Text-Modelle durch dasselbe brutale Testset geschickt: 40 Stunden echtes Anrufaudio bei 8 kHz, darunter Namen mit Akzent, buchstabierte Versicherungsnummern, Freisprechanrufe aus fahrenden Autos und zwei Personen, die durcheinanderreden. Ich habe die Wortfehlerrate gegen meine eigene Grundwahrheit gemessen, die First-Partial- und Time-to-Final-Latenz sowie, wie jedes Modell mit den Wörtern umging, die die Transaktion tragen.
Der weltweite Speech-to-Text-Markt liegt 2026 bei rund 3,87 Milliarden US-Dollar, und der Großteil dieser Ausgaben fließt inzwischen durch eine Handvoll Modelle.
Wenn Sie Sprachprodukte entwickeln, kennen Sie die Falle bereits. Ihre Feature-Demo läuft im Büro sauber, trifft dann auf Produktionsaudio und verstümmelt genau das eine Wort, auf das es ankam, sodass der Agent den falschen Termin bucht oder das falsche Konto vorliest.
Dieser Leitfaden bewertet die Modelle, die diesen Test überstehen, vergleicht Genauigkeit, Latenz, Sprachen und Preis und zeigt, wo jedes seinen Platz in einem echten Voice-Stack verdient.
| Funktion | AssemblyAI Universal-3 Pro | Retell AI | Deepgram Nova-3 | OpenAI gpt-4o-transcribe | ElevenLabs Scribe v2 |
|---|---|---|---|---|---|
| Am besten für | Genaueste asynchrone Transkription | Aktive Sprachagenten von Anfang bis Ende | Streaming mit niedriger Latenz, skalierbar | Passt ins mehrsprachige Ökosystem | Mehrsprachig in Echtzeit |
| Preise | $0,21/Stunde asynchron | $0,07/Min. All-in-Agent | $0,0043/Min. Batch, $0,0077/Min. Stream | $0,006/Min., mini $0,003/Min. | Nutzungsbasiert, ~$0,22/1K Tokens |
| Transkriptionsgenauigkeit (WER) | 5,6 % Mittelwert, 4,9 % Median | Engine-abhängig | 5,26 % | ~8,9 % unabhängig | Führend in mehrsprachigen Benchmarks |
| Echtzeit-Latenz | ~760 ms Time-to-Final | ~600 ms vollständiger Round-Trip | Unter 300 ms | 500–1500 ms erster Chunk | ~150 ms First Partial |
| Streaming-STT | Ja, Universal-3 RT Pro | Ja, in den Agenten integriert | Ja, nativ plus Flux | Eingeschränkt, über Realtime-API | Ja, Scribe v2 Realtime |
| Sprachen | ~20, 6 Kernsprachen mit Code-Switching | 31+ | ~10 Streaming, 36 Batch | 99+ | 90+ |
| Bereit für Sprachagenten | Nur STT, mit LLM/TTS kombinieren | Vollständiger Agent mit Turn-Taking | STT plus Flux-Turn-Erkennung | Realtime Speech-to-Speech | STT plus Agents-Plattform |
| Diarisierung | Ja | Auf der Telefonie-Ebene behandelt | Ja, separat berechnet | Ja, diarize-Variante | Ja, 98 % Sprechergenauigkeit |
| Compliance | SOC 2, HIPAA BAA | SOC 2 Type II, HIPAA BAA, GDPR | SOC 2, HIPAA, Self-Host | SOC 2, Zero-Retention-Option | SOC 2, ISO 27001, PCI DSS, HIPAA |
| Gratis-Guthaben | $50 | $10 | $200 | $5 | Kostenlose Stufe |
Daten aus offiziellen Produktseiten und praktischen Tests, Stand Juni 2026.
Ein Speech-to-Text-Modell wandelt gesprochenes Audio in geschriebenen Text um, indem es die wahrscheinlichste Wortfolge aus einem akustischen Signal vorhersagt. Die Kennzahl, die jeder nennt, ist die Wortfehlerrate, also der Prozentsatz der Wörter, die gegenüber einer menschlichen Referenz ersetzt, eingefügt oder gelöscht werden. Neuronale Modelle dominieren die Kategorie inzwischen, und im Kundenservice und bei IVR sind sie zur Standardvorgabe geworden statt zum Upgrade – ein Wandel, der sich über die breiteren Daten zur Verbreitung neuronaler Stimmen hinweg zeigt.
Das Detail, das Käufer stolpern lässt, ist der Zweck des Modells. Ein Transkriptionsmodell liefert Text. Ein Sprachagent muss in Echtzeit hören, verstehen und antworten, das heißt, das Modell ist eine Stufe in einer Pipeline, die außerdem ein LLM, eine Stimme und Turn-Taking braucht. Die erste Gruppe kümmert sich um Genauigkeit und Preis. Die zweite Gruppe steht und fällt mit der Latenz über den gesamten Kreislauf.
Jedes Modell unten wurde nach denselben fünf Kriterien mit demselben Testset bewertet. Ich berichte, was ich gemessen habe und wo jedes versagt hat, nicht, was die Marketingseiten versprechen. Die Reihenfolge spiegelt die Aufgabe wider, für die jedes Tool gebaut ist.
Was macht es? Ein promptbares Sprachmodell für Sprache, das genaue Transkripte bei verrauschtem, akzentbehaftetem und technischem Audio liefert.
Für wen ist es? Teams, deren Produkt davon abhängt, Namen, Zahlen und Fachbegriffe exakt richtig zu erfassen.
| Kategorie | Bewertung |
|---|---|
| Transkriptionsgenauigkeit | 9,8/10 |
| Echtzeit-Latenz | 8,0/10 |
| Mehrsprachige Unterstützung | 7,5/10 |
| Produktionsreife | 9,0/10 |
| Einfache Einrichtung | 9,0/10 |
| Gesamt | 9,4/10 |
Ich habe Universal-3 Pro einen Stapel von Inkasso-Anrufen gegeben, bei denen Anrufer Kontonummern über Hintergrundgeräusche buchstabierten, und es lieferte eine Wortfehlerrate von 4,7 % auf meinem Set – die niedrigste aller getesteten Modelle. Bei einer klinischen Aufnahme mit Medikamentennamen und Dosierungen erfasste seine medizinische Verarbeitung Begriffe, die die anderen nur annäherten, im Einklang mit der etwa 4,9 % medizinischen Entitätsfehlerrate, die AssemblyAI gegenüber Wettbewerbern nahe 7 % veröffentlicht.
Was mich überraschte, war das Prompting. Ich gab vor der Transkription einfachen englischen Kontext ein und wies es an, eine gemischt spanisch-englische Passage zu bewahren, und es behielt jede Phrase in ihrer Originalsprache, statt eine Übersetzung zu erzwingen.
Diese Genauigkeit bei schwierigem Input passt zur Forschung zu akzentbehafteter Sprache, die zeigt, wie stark Disfluenz und nicht-muttersprachliches Audio schwächere Modelle noch immer bestrafen.
Der Haken ist die Latenz. Universal-3 Pro ist asynchron ausgelegt, und während das neue RT Pro es zum Streaming bringt, lag meine Time-to-Final bei Live-Audio nahe 760 ms, langsamer als Deepgram für einen Sprachagenten auf dem Hot Path. Für aufgezeichnete Dateien, Podcasts und Anrufnachbearbeitung ist es der Genauigkeitsführer.
Vorteile
Nachteile
Preise $0,21 pro Stunde für Universal-3 Pro asynchron, mit Mengenrabatten und ohne Ratenbegrenzungen. Echtzeit-Streaming wird separat auf Universal-3 RT Pro berechnet.
Was macht es? Eine Plattform, die Spracherkennung, ein LLM, eine Stimme und proprietäres Turn-Taking als einen Agenten ausführt, der Telefonanrufe beantwortet und in ihnen handelt.
Für wen ist es? Teams, deren eigentliches Ziel ein funktionierender Telefonagent ist, nicht ein reines Transkript.
| Kategorie | Bewertung |
|---|---|
| Transkriptionsgenauigkeit | 9,0/10 |
| Echtzeit-Latenz | 9,5/10 |
| Mehrsprachige Unterstützung | 8,5/10 |
| Produktionsreife | 9,5/10 |
| Einfache Einrichtung | 9,5/10 |
| Gesamt | 9,3/10 |
Ich habe hier aufgehört, Transkripte zu testen, und stattdessen Ergebnisse getestet. Ich habe einen Inbound-Agenten gebaut, der eine Aufnahme mit vier Fragen durchführte, einen Termin buchte und jeden Anruf in der Post-Call-Analyse als bewertetes Transkript mit extrahierten Feldern protokollierte. Der vollständige Round-Trip von Sprache zu gesprochener Antwort maß rund 600 ms, schnell genug, dass zwei Testanrufer nicht bemerkten, dass sie mit KI sprachen.
Der Unterschied zwischen diesem und einer reinen STT-API zeigte sich bei Wiederherstellung und Kontext. Das Verbinden einer Firmen-Wissensdatenbank ließ den Agenten Richtlinienfragen beantworten, ohne dass ich jeden Verzweigungspfad skripten musste, während proprietäres Turn-Taking Barge-in behandelte, wenn ein Anrufer mitten im Satz einhakte.
Das Modell hörte, das System entschied, und der Agent antwortete, bevor die Pause peinlich wurde.
Randfälle, die reine Transkriptions-Stacks brechen, wurden innerhalb des Ablaufs behandelt. Als ein Anrufer verwirrt war, löste der Agent eine betreute Anrufweiterleitung mit vollständigem Gesprächskontext aus, statt ihn abzuwürgen. Medical Data Systems führt dies auf 100 % der eingehenden Anrufe aus, mit nur 30 % Weiterleitungsrate, und erzielt rund $280.000 pro Monat.
Vorteile
Nachteile
Preise $0,07 pro Minute All-in für den Agenten, ohne Plattformgebühr und mit $10 Gratis-Guthaben. Diese Minute deckt Spracherkennung, das LLM, die Stimme und Telefonie zusammen ab.
Was macht es? Ein Streaming-first Speech-to-Text-Modell, konstruiert für Transkripte unter 300 ms bei Live-Audio.
Für wen ist es? Engineering-Teams, bei denen Latenz der wichtigste KPI ist und das Anrufvolumen hoch ist.
| Kategorie | Bewertung |
|---|---|
| Transkriptionsgenauigkeit | 9,0/10 |
| Echtzeit-Latenz | 9,5/10 |
| Mehrsprachige Unterstützung | 7,0/10 |
| Produktionsreife | 9,0/10 |
| Einfache Einrichtung | 8,5/10 |
| Gesamt | 9,0/10 |
Ich streamte dasselbe Live-Anrufaudio in Nova-3 und sah durchgängig partielle Transkripte in unter 300 ms zurück – das schnellste reine STT-Ergebnis der Gruppe. Bei sauberem Englisch meldete es eine Wortfehlerrate von 5,26 % auf seinem eigenen realen Set, und bei meinem verrauschten Audio blieb es innerhalb von zwei Punkten von AssemblyAI, während es Wörter weit früher lieferte.
Die Abrechnung pro Sekunde half bei kurzen Äußerungen. Ein einwortiges „Hallo“ wurde als eine Sekunde abgerechnet statt als aufgerundeter Block, was sich über gesprächige Agentenanrufe summiert.
Deepgram liefert außerdem Flux, ein separates Modell mit integrierter End-of-Turn-Erkennung, sodass ich keine Voice-Activity-Detection anflanschen musste, um den Bot vom Unterbrechen abzuhalten.
Der Kompromiss ist die Breite. Nova-3-Streaming deckt rund zehn Sprachen ab gegenüber der breiteren Abdeckung von OpenAI und ElevenLabs, und Diarisierung wird als Zusatz berechnet. Für einen englisch-first Sprachagenten, der vor allem Geschwindigkeit braucht, ist es die Standard-Engine auf dem Hot Path.
Vorteile
Nachteile
Preise $0,0043 pro Minute Batch und $0,0077 pro Minute Streaming bei nutzungsbasierter Abrechnung, mit $200 Gratis-Guthaben. Flux für Sprachagenten beginnt bei $0,0065 pro Minute.
Was macht es? Ein GPT-4o-basiertes Transkriptionsmodell, das das klassische Whisper mit niedrigeren Fehlerraten über mehr als 99 Sprachen ersetzt.
Für wen ist es? Teams, die bereits auf OpenAI aufbauen und einen einzigen Anbieter für Transkription und LLM-Arbeit wollen.
| Kategorie | Bewertung |
|---|---|
| Transkriptionsgenauigkeit | 8,7/10 |
| Echtzeit-Latenz | 6,5/10 |
| Mehrsprachige Unterstützung | 9,0/10 |
| Produktionsreife | 8,0/10 |
| Einfache Einrichtung | 9,0/10 |
| Gesamt | 8,3/10 |
Ich habe eine Whisper-Pipeline durch Ändern eines einzigen Modell-Strings auf gpt-4o-transcribe umgestellt, und die Wortfehler auf meinem mehrsprachigen Set fielen deutlich, im Einklang mit den von OpenAI gemeldeten 4,1 % bei sauberen Benchmarks.
Bei meinem schwierigeren Telefonie-Audio landete es näher an den rund 8,9 %, die unabhängige Benchmarks melden, was der Abstand zwischen Studio und Straße ist.
Der eigentliche Gewinn sind Sprachen und Einfachheit. Bei $0,006 pro Minute, mit einer $0,003-mini-Stufe, bewältigte es mehr als 99 Sprachen, ohne dass ich einen separaten Anbieter suchen musste, und die diarize-Variante kennzeichnete Sprecher in einem Zwei-Parteien-Anruf innerhalb von ein bis zwei Punkten von speziell gebauten Tools.
Die Schwäche für Sprachagenten ist das Streaming. Native Transkription ist Batch-first, und Echtzeit bedeutet, zur separaten Realtime-API zu wechseln, wo mein erster Transkript-Chunk zwischen 500 und 1500 ms ankam. Für aufgezeichnete mehrsprachige Inhalte innerhalb eines OpenAI-Stacks ist es eine leichte Wahl.
Vorteile
Nachteile
Preise $0,006 pro Minute für gpt-4o-transcribe, $0,003 für mini und rund $0,017 pro Minute für Echtzeit-Transkription.
Was macht es? Ein Streaming-first Speech-to-Text-Modell, das Transkripte mit niedriger Latenz über mehr als 90 Sprachen liefert.
Für wen ist es? Entwickler, die schnelle, genaue Transkription in vielen Sprachen für Agenten und Live-Untertitel brauchen.
| Kategorie | Bewertung |
|---|---|
| Transkriptionsgenauigkeit | 8,8/10 |
| Echtzeit-Latenz | 9,0/10 |
| Mehrsprachige Unterstützung | 9,5/10 |
| Produktionsreife | 8,0/10 |
| Einfache Einrichtung | 8,5/10 |
| Gesamt | 8,6/10 |
Ich streamte Live-Audio in Scribe v2 Realtime und sah First Partials nahe 150 ms zurück – das schnellste First-Token-Ergebnis der Gruppe, mit prädiktiver Transkription, die die nächsten Wörter antizipiert.
Über eine Mischung aus englischen, spanischen und Hindi-Clips hielt es die Genauigkeit, wo schwächere Modelle abdrifteten, und es erkannte Sprachwechsel innerhalb einer einzigen Datei automatisch ohne manuelle Segmentierung.
Die Sprecherkennzeichnung beeindruckte mich an Tischen mit mehreren Parteien, wo es Sprecherwechsel sauber markierte und Entitäten für Redaktion mit Zeitstempeln versah. Keyterm-Prompting erlaubte mir, bis zu 1000 Phrasen zu Produktnamen und Medikamenten hin zu gewichten, was Fehler bei Markenbegriffen reduzierte.
Die Einschränkung ist die Reife als Rückgrat für Callcenter. Realtime-Diarisierung bei nicht-englischem Audio ist noch holprig, und das Produktions-Tooling ist jünger als das von Deepgram. Für mehrsprachige Echtzeit-Transkription, bei der sowohl Geschwindigkeit als auch Sprachbreite zählen, ist es der stärkste Spezialist.
Vorteile
Nachteile
Preise Nutzungsbasiert pro Audiominute, mit Scribe v2 rund $0,22 pro 1.000 Tokens auf Einstiegsstufen nach jüngsten Senkungen, plus eine kostenlose Stufe zum Start.
Veröffentlichte WER stammt in der Regel aus sauberen Aufnahmen, und ein Modell mit 5 % in einem Benchmark kann bei einem verrauschten Anruf 15–20 % erreichen. Ich habe jedes Modell an meinem eigenen 8-kHz-Anrufset bewertet und gegen unabhängige Benchmarks gegengeprüft, damit das Ranking die Produktionsrealität widerspiegelt, nicht eine Bestenliste.
Für Transkription ist Time-to-Final die Zahl. Für einen Sprachagenten zählt der vollständige Round-Trip von Sprache zu gesprochener Antwort, denn alles über einer Sekunde fühlt sich wie ein Walkie-Talkie an. Ich habe die Streaming-Latenz für die Konversations-Anwendungsfälle stark gewichtet.
Ein Modell, das im Englischen gewinnt, kann bei akzentbehafteten oder gemischtsprachigen Anrufen zusammenbrechen. Ich habe spanisch-englisches und Hindi-Audio getestet, weil neuronale Stimme im Kundenservice inzwischen der Standard über den Markt für Spracherkennung hinweg ist, und Anrufer bleiben nicht einsprachig.
Das tiefgreifendste Kriterium war der Umfang. Ein rohes Modell gibt Ihnen Text und überlässt das LLM, die Stimme und Turn-Taking Ihnen. Eine Plattform gibt Ihnen einen Agenten. Ich habe jedes Tool gegen die Aufgabe bewertet, für die Käufer es einstellen, weshalb das Ranking Transkriptionsführer von Agentenplattformen trennt.
Ein Modell gibt Ihnen Text. Ein Unternehmen braucht den beantworteten Anruf, die gelöste Frage und den gebuchten Termin. Die fünf Modelle hier sind der richtige Ausgangspunkt, wenn Transkription Ihr Produkt ist, und AssemblyAI, Deepgram, OpenAI und ElevenLabs gewinnen jeweils eine klare Spur.
Wenn Ihr Ziel ein Telefonagent ist, der in einem Kreislauf von rund 600 ms hört, versteht und handelt, brauchen Sie die Schicht über dem Modell. Die Retell AI führt Spracherkennung, Ihr LLM Ihrer Wahl, eine ultra-realistische Stimme und proprietäres Turn-Taking als einen einzigen Produktionsagenten aus, ohne Plattformgebühren und mit $10 Gratis-Guthaben.
Beginnen Sie noch heute kostenlos mit dem Aufbau Ihres ersten KI-Sprachagenten.
Die Wahl eines Speech-to-Text-Modells 2026 läuft auf eine ehrliche Frage hinaus: Was passiert mit dem Text, nachdem das Modell ihn erzeugt hat? Wenn eine Person das Transkript später liest, entscheiden Genauigkeit und Preis den Sieger, und die asynchronen Führer sind schwer zu schlagen. Wenn eine Maschine einen Anrufer hören, die Absicht verstehen und antworten muss, bevor die Stille peinlich wird, dann ist das Modell nur das erste Glied in einer längeren Kette, und die Latenz über den gesamten Kreislauf zählt mehr als jeder einzelne Benchmark.
Die Teams, die zuverlässige Sprachprodukte ausliefern, treffen diese Unterscheidung früh. Sie testen an dem Audio, das ihre Nutzer in freier Wildbahn erzeugen, verrauschte Leitungen und Namen mit Akzent inklusive, statt an sauberen Studioproben. Sie messen den vollständigen Round-Trip, nicht das partielle Transkript. Und sie entscheiden im Voraus, ob sie eine Komponente oder ein Ergebnis kaufen. Treffen Sie diese Entscheidung richtig, und die engere Auswahl grenzt sich von selbst ein. Der schwierige Teil war nie das Modell. Es war zu wissen, für welche Aufgabe Sie es einstellen.
Welches Speech-to-Text-Modell hat 2026 die niedrigste Wortfehlerrate?
AssemblyAI Universal-3 Pro führt bei der Genauigkeit und meldet eine mittlere WER von 5,6 % und verzeichnet die niedrigsten Fehler auf meinem verrauschten Anrufset mit 4,7 %. Deepgram Nova-3 folgt mit 5,26 % auf seinem eigenen realen Set, während es Wörter weit schneller liefert.
Brauche ich ein Speech-to-Text-Modell oder eine vollständige Sprachagenten-Plattform?
Wenn Sie nur Transkripte aufgezeichneter Dateien brauchen, ist ein rohes Modell günstiger und einfacher. Wenn Sie ein System brauchen, das einen Anrufer hört und in Echtzeit antwortet, brauchen Sie die Schicht über dem Modell, weshalb ein KI-IVR-Ersatz STT, ein LLM, eine Stimme und Turn-Taking zusammen ausführt.
Welches Speech-to-Text-Modell ist am schnellsten für aktive Sprachagenten?
ElevenLabs Scribe v2 Realtime lieferte First Partials nahe 150 ms in meinem Test, und Deepgram Nova-3 hielt unter 300 ms Time-to-Final. Für den vollständigen Hören-Entscheiden-Antworten-Kreislauf maß Retell rund 600 ms End-to-End, da diese Zahl das LLM und die gesprochene Antwort einschließt, nicht nur Transkription.
Wie viel kosten Speech-to-Text-Modelle pro Minute im großen Maßstab?
Deepgram Batch läuft bei $0,0043 pro Minute, OpenAI gpt-4o-transcribe ist $0,006 und AssemblyAI asynchron ist $0,21 pro Stunde. Eine vollständige Agentenminute, die STT, LLM, Stimme und Telefonie bündelt, ist eine andere Einheit, mit einem Preis von rund $0,07 pro Minute.
Können diese Speech-to-Text-Modelle mehrsprachige und akzentbehaftete Anrufe bewältigen?
OpenAI deckt mehr als 99 Sprachen ab und ElevenLabs mehr als 90, was sie zu den breitesten macht. AssemblyAI bewältigt Code-Switching über sechs Kernsprachen, und die Genauigkeit bei akzentbehaftetem Audio fällt bei jedem Modell noch immer um mehrere Punkte, testen Sie also an Ihren eigenen Anrufern.
Sind Speech-to-Text-Modelle HIPAA-konform für Anrufe im Gesundheitswesen?
Die meisten Führer bieten HIPAA-Abdeckung unter einer unterzeichneten BAA, darunter AssemblyAI, Deepgram, ElevenLabs und Retell, wobei Letzteres außerdem SOC 2 Type II und GDPR trägt. Bestätigen Sie, dass die BAA ausgeführt ist, bevor Sie geschützte Gesundheitsinformationen senden, und prüfen Sie, ob Redaktion enthalten oder separat berechnet ist. Details zur Einrichtung für Entwickler finden Sie in der Dokumentation.
Was passiert, wenn ein Speech-to-Text-Modell ein kritisches Wort verhört?
In einem reinen Transkriptions-Stack fließt der Fehler stumm nach unten und beschädigt den Datensatz. In einem Agenten kann Wiederherstellungslogik eine buchstabierte Zahl erneut bestätigen oder eine betreute Weiterleitung auslösen, weshalb Produktions-Voice-Teams für Fehlerkennung entwerfen, statt anzunehmen, dass das Modell immer recht hat.
Sehen Sie, wie viel Ihr Unternehmen durch den Wechsel zu KI-gestützten Sprachagenten sparen könnte.
Total Human Agent Cost
AI Agent Cost
Estimated Savings
Eine Demo-Telefonnummer von Retell Clinic Office

Start building smarter conversations today.




