I 5 migliori modelli speech-to-text del 2026, testati e classificati


Ho sottoposto cinque modelli di riconoscimento vocale allo stesso brutale set di test: 40 ore di audio di chiamate reali a 8 kHz, inclusi nomi con accento, numeri di polizza scritti per esteso, chiamate in vivavoce da auto in movimento e due persone che parlano contemporaneamente. Ho misurato il tasso di errore di parola sul mio modello di riferimento, la latenza parziale e la latenza finale, e come ciascuno gestiva le parole che veicolano la transazione.
Il mercato globale della conversione da parlato a testo si attesterà intorno ai 3,87 miliardi di dollari nel 2026, e la maggior parte di questa spesa confluirà attualmente in un numero ristretto di modelli.
Se sviluppate prodotti vocali, conoscete già la trappola. Le vostre demo funzionano perfettamente in ufficio, ma quando vengono registrate in produzione, storpiano proprio la parola cruciale, con il risultato che l'agente prenota la data sbagliata o ripete il nome dell'account errato.
Questa guida classifica i modelli che superano tale test, confronta precisione, latenza, lingue supportate e prezzo, e mostra dove ciascuno si guadagna il posto in un vero sistema di riconoscimento vocale.
| Caratteristica | AssemblyAI Universal-3 Pro | Rivelare l'IA | Deepgram Nova-3 | Trascrizione OpenAI gpt-4o | ElevenLabs Scribe v2 |
|---|---|---|---|---|---|
| Ideale per | Trascrizione asincrona ad altissima precisione | Operatori vocali in tempo reale dall'inizio alla fine | Streaming a bassa latenza su larga scala | ecosistema multilingue adatto | Multilingue in tempo reale |
| Prezzi | $0,21/ora asincrono | $0,07/min tutto incluso agente | 0,0043 $/min per batch, 0,0077 $/min per streaming | 0,006 $/min, mini 0,003 $/min | Basato sull'utilizzo, circa 0,22 dollari ogni 1000 token. |
| Accuratezza della trascrizione (WER) | Media del 5,6%, mediana del 4,9%. | Dipendente dal motore | 5,26% | ~8,9% indipendenti | Leader nei benchmark multilingue |
| Latenza in tempo reale | Tempo di completamento: ~760 ms | Circa 600 ms per l'intero tragitto di andata e ritorno. | Meno di 300 ms | 500-1500 ms primo blocco | ~150ms prima parte |
| Streaming STT | Sì, Universal-3 RT Pro | Sì, integrato nell'agente | Sì, nativo più Flux | Limitato, tramite API in tempo reale | Sì, Scribe v2 in tempo reale |
| Lingue | ~20, 6 core code-switching | 31+ | ~10 streaming, 36 batch | 99+ | 90+ |
| Agente vocale pronto | Solo STT, compatibile con LLM/TTS | Agente completo con gestione dei turni | Rilevamento della svolta del flusso STT più | Sintesi vocale in tempo reale | Piattaforma STT Plus Agents |
| Diarizzazione | SÌ | Gestito a livello di telefonia | Sì, il prezzo è indicato separatamente. | Sì, variante diarizzata | Sì, precisione del 98% nell'utilizzo del parlato. |
| Conformità | SOC 2, HIPAA BAA | SOC 2 Tipo II, HIPAA BAA, GDPR | SOC 2, HIPAA, self-host | SOC 2, opzione a ritenzione zero | SOC 2, ISO 27001, PCI DSS, HIPAA |
| Crediti gratuiti | 50 dollari | $10 | $200 | 5 dollari | Livello gratuito |
Dati ricavati dalle pagine ufficiali dei prodotti e da test pratici effettuati a giugno 2026.
Un modello di conversione da parlato a testo trasforma l'audio parlato in testo scritto prevedendo la sequenza di parole più probabile a partire da un segnale acustico. La metrica più citata è il tasso di errore di parola, ovvero la percentuale di parole sostituite, inserite o eliminate rispetto a un riferimento umano. I modelli neurali dominano ormai questo settore e, nell'ambito del servizio clienti e dei sistemi IVR, sono diventati lo standard predefinito anziché un'opzione aggiuntiva, un cambiamento visibile nei dati più ampi sull'adozione della voce neurale .
Il dettaglio che mette in difficoltà gli acquirenti è proprio ciò a cui serve il modello. Un modello di trascrizione restituisce del testo. Un operatore vocale deve ascoltare, comprendere e rispondere in tempo reale, il che significa che il modello è solo una fase di una pipeline che richiede anche un LLM, una voce e la gestione dei turni di parola. Il primo gruppo si preoccupa dell'accuratezza e del prezzo. Il secondo gruppo, invece, dipende interamente dalla latenza dell'intero ciclo.
Ciascun modello riportato di seguito è stato valutato in base agli stessi cinque criteri utilizzando lo stesso set di test. Riporto ciò che ho misurato e dove ogni modello ha fallito, non ciò che promettono le pagine di marketing. L'ordine riflette la funzione per cui ogni strumento è stato progettato.
Di cosa si tratta? Un modello di linguaggio parlato con suggerimenti che restituisce trascrizioni di alta precisione anche in presenza di audio rumorosi, con accenti particolari o di contenuto tecnico.
A chi è rivolto? Ai team il cui prodotto dipende dall'inserimento preciso e corretto di nomi, numeri e termini di dominio.
| Categoria | Punto |
|---|---|
| Accuratezza della trascrizione | 9,8/10 |
| Latenza in tempo reale | 8.0/10 |
| Supporto multilingue | 7,5/10 |
| Prontezza alla produzione | 9.0/10 |
| Facilità di configurazione | 9.0/10 |
| Complessivamente | 9,4/10 |
Ho fornito a Universal-3 Pro una serie di chiamate di recupero crediti in cui i chiamanti scandivano i numeri di conto su un rumore di fondo, e ha restituito un tasso di errore di parola del 4,7% sul mio set, il più basso di tutti i modelli che ho testato. Su una registrazione clinica con nomi di farmaci e dosaggi, la sua gestione medica ha individuato i termini che gli altri hanno approssimato, eguagliando il tasso di errore di entità mediche di circa il 4,9% pubblicato da AssemblyAI contro il 7% dei concorrenti.
Ciò che mi ha sorpreso è stato il modo in cui è stato impostato il sistema. Ho inserito un contesto in inglese semplice prima della trascrizione, chiedendo di preservare un passaggio misto spagnolo-inglese, e il sistema ha mantenuto ogni frase nella sua lingua originale invece di forzarne la traduzione.
Tale accuratezza nell'input diretto è in linea con le ricerche sul parlato con accento che dimostrano come la disfluenza e l'audio non nativo penalizzino ancora i modelli meno performanti.
Il problema è la latenza. Universal-3 Pro è incentrato sull'asincronia e, sebbene il nuovo RT Pro lo introduca nello streaming, il mio tempo di risposta finale sull'audio in diretta si è attestato intorno ai 760 ms, più lento di Deepgram per un agente vocale a percorso diretto. Per i file registrati, i podcast e le analisi post-chiamata, è il leader in termini di precisione.
Vantaggi
Svantaggi
Il prezzo per Universal-3 Pro asincrono è di 0,21 dollari all'ora, con sconti per volumi elevati e senza limiti di tariffazione. Lo streaming in tempo reale viene fatturato separatamente su Universal-3 RT Pro.
Di cosa si tratta? Una piattaforma che integra il riconoscimento vocale, un LLM, un sistema vocale e un meccanismo proprietario di gestione dei turni, il tutto in un unico agente che risponde alle chiamate telefoniche e interagisce con esse.
A chi è rivolto? Ai team il cui vero obiettivo è un operatore telefonico efficiente, non una semplice trascrizione.
| Categoria | Punto |
|---|---|
| Accuratezza della trascrizione | 9.0/10 |
| Latenza in tempo reale | 9,5/10 |
| Supporto multilingue | 8,5/10 |
| Prontezza alla produzione | 9,5/10 |
| Facilità di configurazione | 9,5/10 |
| Complessivamente | 9,3/10 |
Ho interrotto i test sulle trascrizioni e ho iniziato a testare i risultati. Ho creato un agente inbound che eseguiva un colloquio iniziale di quattro domande, prenotava uno slot e registrava ogni chiamata per l'analisi successiva, generando una trascrizione con punteggio e campi estratti. L'intero ciclo, dalla voce alla risposta vocale, durava circa 600 ms, un tempo talmente breve che due operatori di prova non si sono accorti di stare parlando con un'intelligenza artificiale.
La differenza tra questo e una semplice API STT si è manifestata in fase di recupero e contestualizzazione. Il collegamento a una knowledge base aziendale ha permesso all'agente di rispondere alle domande sulle policy senza che io dovessi programmare ogni singola ramificazione, mentre la gestione proprietaria dei turni di parola ha gestito le interruzioni quando un chiamante interrompeva una frase a metà.
Il modello ha ascoltato, il sistema ha deciso e l'agente ha risposto prima che la pausa diventasse imbarazzante.
I casi limite che interferivano con le trascrizioni automatiche venivano gestiti all'interno del flusso. Quando un chiamante si confondeva, l'operatore avviava un trasferimento di chiamata con il contesto completo della conversazione anziché interrompere la chiamata. Medical Data Systems utilizza questo sistema per il 100% delle chiamate in entrata, con un tasso di trasferimento di solo il 30%, generando un ricavo di circa 280.000 dollari al mese.
Vantaggi
Svantaggi
Il prezzo è di 0,07 dollari al minuto, tutto incluso per l'agente, senza costi di piattaforma e con 10 dollari di crediti gratuiti. Il minuto include il riconoscimento vocale, il modulo LLM, la voce e la telefonia.
Di cosa si tratta? Un modello di conversione da parlato a testo basato sullo streaming, progettato per trascrizioni in meno di 300 ms su audio in diretta.
A chi è destinato? Ai team di ingegneri in cui la latenza è il principale KPI e il volume delle chiamate è elevato.
| Categoria | Punto |
|---|---|
| Accuratezza della trascrizione | 9.0/10 |
| Latenza in tempo reale | 9,5/10 |
| Supporto multilingue | 7.0/10 |
| Prontezza alla produzione | 9.0/10 |
| Facilità di configurazione | 8,5/10 |
| Complessivamente | 9.0/10 |
Ho trasmesso in streaming lo stesso audio di una chiamata dal vivo a Nova-3 e ho costantemente ottenuto trascrizioni parziali in meno di 300 ms, il risultato più veloce del gruppo per la pura elaborazione STT. Su un inglese pulito ha riportato un tasso di errore di parola del 5,26% sul suo set di dati reale, e sul mio audio rumoroso si è mantenuto entro due punti da AssemblyAI, restituendo le parole molto più velocemente.
La fatturazione al secondo si è rivelata utile per le frasi brevi. Un semplice "ciao" veniva fatturato come un secondo anziché come un blocco arrotondato per eccesso, che si sommava nel corso di lunghe chiamate con un operatore.
Deepgram include anche Flux, un modello separato con rilevamento integrato della fine del turno, quindi non ho dovuto aggiungere un sistema di rilevamento dell'attività vocale per impedire al bot di interrompere.
Il compromesso sta nella copertura. Lo streaming di Nova-3 copre circa dieci lingue rispetto alla copertura più ampia di OpenAI e ElevenLabs, e la diarizzazione è disponibile come componente aggiuntivo a pagamento. Per un agente vocale che utilizza principalmente l'inglese e che ha bisogno soprattutto di velocità, è il motore predefinito nel percorso di elaborazione principale.
Vantaggi
Svantaggi
Prezzi: $0,0043 al minuto per batch e $0,0077 al minuto per streaming con pagamento a consumo, con $200 di crediti gratuiti. Flux per gli operatori vocali parte da $0,0065 al minuto.
Di cosa si tratta? È un modello di trascrizione basato su GPT-40 che sostituisce il vecchio Whisper, offrendo tassi di errore inferiori in oltre 99 lingue.
A chi è rivolto? Ai team che già utilizzano OpenAI e desiderano un unico fornitore per la trascrizione e i lavori di LLM.
| Categoria | Punto |
|---|---|
| Accuratezza della trascrizione | 8,7/10 |
| Latenza in tempo reale | 6,5/10 |
| Supporto multilingue | 9.0/10 |
| Prontezza alla produzione | 8.0/10 |
| Facilità di configurazione | 9.0/10 |
| Complessivamente | 8,3/10 |
Ho convertito una pipeline Whisper in gpt-4o-transcribe modificando una stringa del modello e gli errori di parola sul mio set multilingue sono diminuiti notevolmente, in linea con il 4,1% riportato da OpenAI su benchmark puliti.
Per quanto riguarda l'audio telefonico più impegnativo, il risultato si è avvicinato all'8,9% circa riportato dai benchmark indipendenti , ovvero la differenza tra la registrazione in studio e quella in strada.
Il vero punto di forza è la compatibilità con diverse lingue e la semplicità d'uso. A 0,006 dollari al minuto, con un piano mini da 0,003 dollari, ha gestito oltre 99 lingue senza che dovessi cercare un fornitore separato, e la variante con funzione di agenda ha identificato i partecipanti a una chiamata a due con una precisione di uno o due punti, grazie agli strumenti appositamente creati.
Il punto debole degli agenti vocali è lo streaming. La trascrizione nativa è batch-first, mentre per il tempo reale è necessario passare all'API Realtime separata, dove il mio primo blocco di trascrizione è arrivato tra 500 e 1500 ms. Per i contenuti multilingue registrati all'interno di uno stack OpenAI, la scelta è ovvia.
Vantaggi
Svantaggi
I prezzi sono di 0,006 dollari al minuto per gpt-4o-transcribe, 0,003 dollari per mini e circa 0,017 dollari al minuto per la trascrizione in tempo reale.
Di cosa si tratta? Un modello di conversione da parlato a testo basato sullo streaming che fornisce trascrizioni a bassa latenza in oltre 90 lingue.
A chi è rivolto? Ai costruttori che necessitano di trascrizioni rapide e accurate in molte lingue per gli operatori e i sottotitoli in tempo reale.
| Categoria | Punto |
|---|---|
| Accuratezza della trascrizione | 8,8/10 |
| Latenza in tempo reale | 9.0/10 |
| Supporto multilingue | 9,5/10 |
| Prontezza alla produzione | 8.0/10 |
| Facilità di configurazione | 8,5/10 |
| Complessivamente | 8,6/10 |
Ho trasmesso l'audio in diretta a Scribe v2 Realtime e ho visto i primi risultati parziali in circa 150 ms, il risultato più veloce del gruppo per il primo token, con la trascrizione predittiva che anticipava le parole successive.
In un mix di clip in inglese, spagnolo e hindi, ha mantenuto la precisione laddove i modelli meno performanti hanno mostrato delle lacune, e ha rilevato automaticamente i cambi di lingua all'interno di un singolo file senza necessità di segmentazione manuale.
La funzione di etichettatura degli oratori mi ha impressionato durante le discussioni con più partecipanti, dove ha identificato chiaramente i turni di parola e ha fornito timestamp alle entità da oscurare. Il suggerimento di parole chiave mi ha permesso di dare priorità a un massimo di 1000 frasi, privilegiando nomi di prodotti e farmaci, riducendo così gli errori sui termini di marca.
Il limite risiede nella sua maturità come infrastruttura portante per i call center. La diarizzazione in tempo reale di audio non in inglese è ancora rudimentale e gli strumenti di produzione sono più recenti rispetto a quelli di Deepgram. Per la trascrizione multilingue in tempo reale, dove velocità e ampiezza linguistica sono entrambe importanti, è lo specialista più valido.
Vantaggi
Svantaggi
Il prezzo è basato sull'utilizzo, calcolato al minuto di audio. Scribe v2 costa circa 0,22 dollari ogni 1.000 token nei piani base, dopo i recenti ribassi, e offre un piano gratuito per iniziare.
Il WER pubblicato di solito deriva da registrazioni pulite e un modello con un 5% su un benchmark può raggiungere il 15-20% su una chiamata rumorosa. Ho valutato ogni modello sul mio set di chiamate a 8 kHz e ho confrontato i risultati con benchmark indipendenti, quindi la classifica riflette la realtà della produzione, non una classifica generale.
Per la trascrizione, il tempo di completamento è il dato più importante. Per un operatore vocale, ciò che conta è il tempo totale di andata e ritorno, dal parlato alla risposta vocale, perché qualsiasi ritardo superiore a un secondo dà la sensazione di una comunicazione via radio. Ho dato grande importanza alla latenza dello streaming per i casi d'uso conversazionali.
Un modello che funziona bene in inglese può fallire nelle chiamate con accento straniero o in lingue miste. Ho testato l'audio spagnolo-inglese e hindi perché la voce neurale è ormai lo standard nel servizio clienti in tutto il mercato del riconoscimento vocale e i chiamanti non sono monolingue.
Il criterio più importante era la portata. Un modello grezzo fornisce il testo e lascia a te la gestione del linguaggio naturale, della voce e dell'alternanza dei turni. Una piattaforma ti mette a disposizione un agente. Ho valutato ogni strumento in base al tipo di lavoro per cui i clienti lo utilizzano, ed è per questo che la classifica distingue i leader del settore della trascrizione dalle piattaforme con agenti.
Un modello ti fornisce il testo. Un'azienda ha bisogno che la chiamata venga risposta, la domanda risolta e l'appuntamento fissato. I cinque modelli qui presentati sono il punto di partenza ideale se la trascrizione è il tuo prodotto, e AssemblyAI, Deepgram, OpenAI ed ElevenLabs si ritagliano uno spazio ben definito.
Se il tuo obiettivo è un operatore telefonico in grado di ascoltare, comprendere e agire in un ciclo di circa 600 ms, hai bisogno di un livello superiore al modello. Retell AI integra il riconoscimento vocale, il modello LLM a tua scelta, una voce ultra-realistica e un sistema proprietario di gestione dei turni, il tutto in un unico agente di produzione, senza costi di piattaforma e con 10 dollari di crediti gratuiti .
Inizia oggi stesso a creare il tuo primo agente vocale basato sull'intelligenza artificiale, gratuitamente.
La scelta di un modello di conversione da parlato a testo nel 2026 si riduce a una domanda fondamentale: cosa succede al testo dopo che il modello lo ha prodotto? Se una persona legge la trascrizione in un secondo momento, accuratezza e prezzo sono i fattori decisivi, e i leader nel settore della conversione asincrona sono difficili da battere. Se una macchina deve ascoltare chi chiama, comprenderne l'intento e rispondere prima che il silenzio diventi imbarazzante, allora il modello è solo il primo anello di una catena più lunga, e la latenza dell'intero processo è più importante di qualsiasi singolo parametro di riferimento.
I team che realizzano prodotti vocali affidabili fanno questa distinzione fin da subito. Eseguono i test sull'audio prodotto dagli utenti in situazioni reali, con voci rumorose e nomi con accenti diversi, anziché su campioni audio puliti provenienti da studio. Misurano l'intero percorso di andata e ritorno, non la trascrizione parziale. E decidono in anticipo se stanno acquistando un componente o un risultato. Prendendo la decisione giusta, la rosa dei candidati si restringe. La parte difficile non è mai stata il modello, ma capire per quale scopo lo si stava utilizzando.
Quale modello di riconoscimento vocale avrà il tasso di errore di parola più basso nel 2026?
AssemblyAI Universal-3 Pro è leader in termini di precisione, con un WER medio del 5,6% e il minor numero di errori sul mio set di chiamate rumorose, pari al 4,7%. Deepgram Nova-3 segue con il 5,26% sul proprio set di dati reali, restituendo le parole molto più velocemente.
Ho bisogno di un modello di conversione da parlato a testo o di una piattaforma completa di agente vocale?
Se hai bisogno solo di trascrizioni di file registrati, un modello grezzo è più economico e semplice. Se invece ti serve un sistema che ascolta un chiamante e risponde in tempo reale, hai bisogno del livello superiore al modello, ed è per questo che un sistema IVR basato sull'IA integra STT, LLM, una voce e la gestione dei turni di risposta.
Qual è il modello di conversione da parlato a testo più veloce per gli operatori vocali in tempo reale?
Nel mio test, ElevenLabs Scribe v2 Realtime ha restituito tempi di risposta parziali di circa 150 ms, mentre Deepgram Nova-3 si è mantenuto al di sotto dei 300 ms. Per l'intero ciclo di ascolto-decisione-risposta, Retell ha misurato circa 600 ms end-to-end, poiché tale valore include il modello LLM e la risposta vocale, non solo la trascrizione.
Quanto costano al minuto i modelli di conversione da parlato a testo su larga scala?
Deepgram batch costa $0,0043 al minuto, OpenAI gpt-4o-transcribe costa $0,006 e AssemblyAI async costa $0,21 all'ora. Un minuto agente completo che include STT, LLM, voce e telefonia è un'unità diversa, con un prezzo di circa $0,07 al minuto.
Questi modelli di riconoscimento vocale sono in grado di gestire chiamate multilingue e con accenti diversi?
OpenAI copre oltre 99 lingue ed ElevenLabs oltre 90, risultando così i più completi. AssemblyAI gestisce il code-switching in sei lingue principali e la precisione sull'audio con accento cala ancora di diversi punti per ogni modello, quindi è consigliabile testarlo sui propri interlocutori.
I modelli di conversione da parlato a testo sono conformi alla normativa HIPAA per le chiamate in ambito sanitario?
La maggior parte dei leader del settore offre la conformità HIPAA tramite un BAA (Business Associate Agreement) firmato, tra cui AssemblyAI, Deepgram, ElevenLabs e Retell, quest'ultimo anche certificato SOC 2 Type II e conforme al GDPR. Prima di inviare qualsiasi informazione sanitaria protetta, è necessario verificare che il BAA sia stato sottoscritto e se la redazione dei dati è inclusa o fatturata separatamente. I dettagli per la configurazione da parte degli sviluppatori sono disponibili nella documentazione .
Cosa succede quando un modello di riconoscimento vocale non interpreta correttamente una parola chiave?
In un sistema di sola trascrizione, l'errore si propaga silenziosamente a valle e corrompe la registrazione. In un sistema con agente, la logica di recupero può riconfermare un numero digitato correttamente o attivare un trasferimento a caldo, motivo per cui i team di produzione vocale progettano tenendo conto dei possibili errori di riconoscimento, anziché presumere che il modello sia sempre corretto.
See how much your business could save by switching to AI-powered voice agents.
Total Human Agent Cost
AI Agent Cost
Estimated Savings
Un numero di telefono demo di Retell Clinic Office

Start building smarter conversations today.




