Los 5 mejores modelos de voz a texto en 2026, probados y clasificados


Sometí cinco modelos de voz a texto al mismo conjunto de pruebas brutal: 40 horas de audio de llamadas reales a 8 kHz, con nombres con acento, números de póliza deletreados, llamadas con manos libres desde coches en movimiento y dos personas hablando a la vez. Medí la tasa de error de palabra sobre mi propia referencia real, la latencia de primer parcial y hasta el resultado final, y cómo cada uno manejaba las palabras que sostienen la transacción.
El mercado global de voz a texto se sitúa cerca de los 3.870 millones de dólares en 2026, y la mayor parte de ese gasto fluye ahora a través de un puñado de modelos.
Si construyes productos de voz, ya conoces la trampa. Tu función se demuestra impecable en la oficina, luego se topa con el audio de producción y destroza la única palabra que importaba, así que el agente reserva la fecha equivocada o lee la cuenta equivocada.
Esta guía clasifica los modelos que superan esa prueba, compara precisión, latencia, idiomas y precio, y muestra dónde se gana cada uno su sitio en un stack de voz real.
| Característica | AssemblyAI Universal-3 Pro | Retell AI | Deepgram Nova-3 | OpenAI gpt-4o-transcribe | ElevenLabs Scribe v2 |
|---|---|---|---|---|---|
| Mejor para | Transcripción asíncrona de máxima precisión | Agentes de voz en directo de extremo a extremo | Streaming de baja latencia a escala | Encaje en ecosistema multilingüe | Multilingüe en tiempo real |
| Precios | 0,21 $/hora asíncrono | 0,07 $/min agente todo incluido | 0,0043 $/min por lotes, 0,0077 $/min streaming | 0,006 $/min, mini 0,003 $/min | Según uso, ~0,22 $/1K tokens |
| Precisión de transcripción (WER) | 5,6 % media, 4,9 % mediana | Depende del motor | 5,26 % | ~8,9 % independiente | Lidera los benchmarks multilingües |
| Latencia en tiempo real | ~760 ms hasta el resultado final | ~600 ms ida y vuelta completa | Menos de 300 ms | 500-1500 ms primer fragmento | ~150 ms primer parcial |
| STT en streaming | Sí, Universal-3 RT Pro | Sí, integrado en el agente | Sí, nativo más Flux | Limitado, vía Realtime API | Sí, Scribe v2 Realtime |
| Idiomas | ~20, 6 principales con cambio de código | Más de 31 | ~10 en streaming, 36 por lotes | Más de 99 | Más de 90 |
| Listo para agentes de voz | Solo STT, combínalo con LLM/TTS | Agente completo con gestión de turnos | STT más detección de turnos Flux | Voz a voz en tiempo real | STT más plataforma Agents |
| Diarización | Sí | Gestionada en la capa de telefonía | Sí, con precio aparte | Sí, variante diarize | Sí, 98 % de precisión de hablante |
| Cumplimiento | SOC 2, HIPAA BAA | SOC 2 Type II, HIPAA BAA, GDPR | SOC 2, HIPAA, autoalojado | SOC 2, opción de retención cero | SOC 2, ISO 27001, PCI DSS, HIPAA |
| Créditos gratis | 50 $ | 10 $ | 200 $ | 5 $ | Plan gratuito |
Datos obtenidos de las páginas oficiales de producto y de pruebas prácticas a junio de 2026.
Un modelo de voz a texto convierte el audio hablado en texto escrito prediciendo la secuencia de palabras más probable a partir de una señal acústica. La métrica que todos citan es la tasa de error de palabra, el porcentaje de palabras sustituidas, insertadas o eliminadas frente a una referencia humana. Los modelos neuronales dominan ahora la categoría y, en atención al cliente e IVR, se han convertido en la especificación por defecto en lugar de una mejora, un cambio visible en los datos más amplios de adopción de voz neuronal.
El detalle que confunde a los compradores es para qué sirve el modelo. Un modelo de transcripción devuelve texto. Un agente de voz tiene que oír, entender y responder en tiempo real, lo que significa que el modelo es una etapa de una cadena que también necesita un LLM, una voz y gestión de turnos. El primer grupo se preocupa por la precisión y el precio. El segundo vive o muere por la latencia de todo el bucle.
Cada modelo a continuación se puntuó con los mismos cinco criterios usando el mismo conjunto de pruebas. Informo de lo que medí y de dónde falló cada uno, no de lo que prometen las páginas de marketing. El orden refleja el trabajo para el que está diseñada cada herramienta.
¿Qué hace? Un modelo de lenguaje del habla al que puedes dar instrucciones y que devuelve transcripciones de alta precisión sobre audio ruidoso, con acento y técnico.
¿Para quién es? Equipos cuyo producto depende de captar nombres, números y términos del sector con total exactitud.
| Categoría | Puntuación |
|---|---|
| Precisión de transcripción | 9,8/10 |
| Latencia en tiempo real | 8,0/10 |
| Soporte multilingüe | 7,5/10 |
| Preparación para producción | 9,0/10 |
| Facilidad de configuración | 9,0/10 |
| Global | 9,4/10 |
Alimenté Universal-3 Pro con un lote de llamadas de cobros en las que quienes llamaban deletreaban números de cuenta sobre ruido de fondo, y devolvió una tasa de error de palabra del 4,7 % en mi conjunto, la más baja de todos los modelos que probé. En una grabación clínica con nombres de fármacos y dosis, su manejo médico captó términos que los demás aproximaron, ajustándose a la tasa de error de entidad médica de en torno al 4,9 % que AssemblyAI publica frente a rivales cercanos al 7 %.
Lo que me sorprendió fue la posibilidad de darle instrucciones. Le pasé contexto en inglés sencillo antes de la transcripción, indicándole que preservara un pasaje mixto de español e inglés, y mantuvo cada frase en su idioma original en lugar de forzar una traducción.
Esa precisión con entradas difíciles concuerda con la investigación sobre habla con acento que muestra cuánto siguen penalizando la disfluencia y el audio no nativo a los modelos más débiles.
El inconveniente es la latencia. Universal-3 Pro es asíncrono en primer lugar y, aunque el nuevo RT Pro lo lleva al streaming, mi tiempo hasta el resultado final en audio en directo se situó cerca de los 760 ms, más lento que Deepgram para un agente de voz en la ruta crítica. Para archivos grabados, pódcast y análisis posterior a la llamada, es el líder en precisión.
Pros
Contras
Precios 0,21 $ por hora para Universal-3 Pro asíncrono, con descuentos por volumen y sin límites de tasa. El streaming en tiempo real se factura aparte en Universal-3 RT Pro.
¿Qué hace? Una plataforma que ejecuta reconocimiento de voz, un LLM, una voz y gestión de turnos propia como un único agente que responde y actúa en las llamadas telefónicas.
¿Para quién es? Equipos cuyo objetivo real es un agente telefónico funcional, no una transcripción en bruto.
| Categoría | Puntuación |
|---|---|
| Precisión de transcripción | 9,0/10 |
| Latencia en tiempo real | 9,5/10 |
| Soporte multilingüe | 8,5/10 |
| Preparación para producción | 9,5/10 |
| Facilidad de configuración | 9,5/10 |
| Global | 9,3/10 |
Aquí dejé de probar transcripciones y probé resultados. Construí un agente entrante que ejecutaba una recopilación de cuatro preguntas, reservaba una franja y registraba cada llamada en análisis posterior a la llamada como una transcripción puntuada con campos extraídos. La ida y vuelta completa desde el habla hasta la respuesta hablada midió unos 600 ms, lo bastante rápido como para que dos personas de prueba no se dieran cuenta de que hablaban con una IA.
La diferencia entre esto y una API de STT en bruto apareció en la recuperación y el contexto. Conectar una base de conocimiento de la empresa permitió al agente responder preguntas de política sin que yo tuviera que guionizar cada rama, mientras la gestión de turnos propia manejaba la interrupción cuando alguien cortaba a media frase.
El modelo oyó, el sistema decidió y el agente respondió antes de que la pausa se volviera incómoda.
Los casos límite que rompen los stacks de solo transcripción se manejaron dentro del flujo. Cuando quien llamaba se confundía, el agente activaba una transferencia de llamadas asistida con contexto completo de la conversación en lugar de dejarlo colgado. Medical Data Systems ejecuta esto en el 100 % de las llamadas entrantes con solo un 30 % de tasa de transferencia, recaudando unos 280.000 $ al mes.
Pros
Contras
Precios 0,07 $ por minuto todo incluido para el agente, sin cuota de plataforma y con 10 $ en créditos gratis. Ese minuto cubre el reconocimiento de voz, el LLM, la voz y la telefonía juntos.
¿Qué hace? Un modelo de voz a texto pensado primero para streaming, diseñado para transcripciones en menos de 300 ms sobre audio en directo.
¿Para quién es? Equipos de ingeniería donde la latencia es el KPI principal y el volumen de llamadas es alto.
| Categoría | Puntuación |
|---|---|
| Precisión de transcripción | 9,0/10 |
| Latencia en tiempo real | 9,5/10 |
| Soporte multilingüe | 7,0/10 |
| Preparación para producción | 9,0/10 |
| Facilidad de configuración | 8,5/10 |
| Global | 9,0/10 |
Transmití el mismo audio de llamada en directo a Nova-3 y vi de forma constante transcripciones parciales de vuelta en menos de 300 ms, el resultado de STT puro más rápido del grupo. En inglés limpio informó de una tasa de error de palabra del 5,26 % en su propio conjunto real, y con mi audio ruidoso se mantuvo a menos de dos puntos de AssemblyAI devolviendo las palabras mucho antes.
La facturación por segundo ayudó con enunciados cortos. Un "hola" de una palabra se facturó como un segundo en lugar de como un bloque redondeado hacia arriba, lo que suma en llamadas de agente muy habladas.
Deepgram también incluye Flux, un modelo aparte con detección de fin de turno integrada, así que no tuve que añadir detección de actividad de voz para evitar que el bot interrumpiera.
El compromiso es la amplitud. El streaming de Nova-3 cubre en torno a diez idiomas frente a la cobertura más amplia de OpenAI y ElevenLabs, y la diarización tiene precio como complemento. Para un agente de voz que prioriza el inglés y necesita velocidad por encima de todo, es el motor por defecto en la ruta crítica.
Pros
Contras
Precios 0,0043 $ por minuto por lotes y 0,0077 $ por minuto en streaming con pago por uso, con 200 $ en créditos gratis. Flux para agentes de voz parte de 0,0065 $ por minuto.
¿Qué hace? Un modelo de transcripción basado en GPT-4o que sustituye al antiguo Whisper con tasas de error más bajas en más de 99 idiomas.
¿Para quién es? Equipos que ya construyen sobre OpenAI y quieren un único proveedor para la transcripción y el trabajo con LLM.
| Categoría | Puntuación |
|---|---|
| Precisión de transcripción | 8,7/10 |
| Latencia en tiempo real | 6,5/10 |
| Soporte multilingüe | 9,0/10 |
| Preparación para producción | 8,0/10 |
| Facilidad de configuración | 9,0/10 |
| Global | 8,3/10 |
Cambié un pipeline de Whisper a gpt-4o-transcribe modificando una sola cadena de modelo, y los errores de palabra en mi conjunto multilingüe bajaron notablemente, en línea con el 4,1 % que OpenAI reporta en benchmarks limpios.
Con mi audio de telefonía más difícil se acercó al 8,9 % aproximado que reportan los benchmarks independientes, que es la diferencia entre el estudio y la calle.
La verdadera ventaja son los idiomas y la sencillez. A 0,006 $ por minuto, con un nivel mini de 0,003 $, manejó más de 99 idiomas sin que yo tuviera que buscar un proveedor aparte, y la variante diarize etiquetó a los hablantes en una llamada de dos partes a uno o dos puntos de las herramientas diseñadas a tal fin.
La debilidad para los agentes de voz es el streaming. La transcripción nativa es por lotes en primer lugar, y el tiempo real implica pasar a la Realtime API aparte, donde mi primer fragmento de transcripción llegó entre 500 y 1500 ms. Para contenido multilingüe grabado dentro de un stack de OpenAI, es una elección fácil.
Pros
Contras
Precios 0,006 $ por minuto para gpt-4o-transcribe, 0,003 $ para mini y unos 0,017 $ por minuto para transcripción en tiempo real.
¿Qué hace? Un modelo de voz a texto pensado primero para streaming que entrega transcripciones de baja latencia en más de 90 idiomas.
¿Para quién es? Creadores que necesitan transcripción rápida y precisa en muchos idiomas para agentes y subtítulos en directo.
| Categoría | Puntuación |
|---|---|
| Precisión de transcripción | 8,8/10 |
| Latencia en tiempo real | 9,0/10 |
| Soporte multilingüe | 9,5/10 |
| Preparación para producción | 8,0/10 |
| Facilidad de configuración | 8,5/10 |
| Global | 8,6/10 |
Transmití audio en directo a Scribe v2 Realtime y vi primeros parciales de vuelta cerca de los 150 ms, el resultado de primer token más rápido del grupo, con transcripción predictiva anticipando las siguientes palabras.
En una mezcla de clips en inglés, español e hindi mantuvo la precisión donde los modelos más débiles se desviaban, y detectó automáticamente los cambios de idioma dentro de un mismo archivo sin segmentación manual.
El etiquetado de hablantes me impresionó en mesas con varias partes, donde marcó los turnos con limpieza y puso marcas de tiempo a las entidades para su redacción. La orientación por términos clave me permitió sesgar hasta 1000 frases hacia nombres de producto y medicamentos, lo que redujo los errores en términos de marca.
La limitación es su madurez como columna vertebral de un call center. La diarización en tiempo real sobre audio no inglés todavía es tosca, y las herramientas de producción son más jóvenes que las de Deepgram. Para transcripción multilingüe en tiempo real donde importan tanto la velocidad como la amplitud de idiomas, es el especialista más fuerte.
Pros
Contras
Precios Según uso por minuto de audio, con Scribe v2 en torno a 0,22 $ por cada 1.000 tokens en los niveles de entrada tras recortes recientes, más un plan gratuito para empezar.
El WER publicado suele proceder de grabaciones limpias, y un modelo al 5 % en un benchmark puede alcanzar el 15-20 % en una llamada ruidosa. Puntué cada modelo con mi propio conjunto de llamadas a 8 kHz y lo contrasté con benchmarks independientes para que la clasificación refleje la realidad de producción, no una tabla de líderes.
Para la transcripción, la cifra es el tiempo hasta el resultado final. Para un agente de voz, lo que importa es la ida y vuelta completa desde el habla hasta la respuesta hablada, porque cualquier cosa por encima de un segundo parece un walkie-talkie. Ponderé mucho la latencia de streaming para los casos de uso conversacionales.
Un modelo que gana en inglés puede derrumbarse con llamadas con acento o en idiomas mezclados. Probé audio en español-inglés e hindi porque la voz neuronal es ya lo habitual en atención al cliente en todo el mercado de reconocimiento de voz, y quienes llaman no se quedan en un solo idioma.
El criterio más profundo fue el alcance. Un modelo en bruto te da texto y te deja a ti el LLM, la voz y la gestión de turnos. Una plataforma te da un agente. Puntué cada herramienta frente al trabajo para el que los compradores la contratan, por eso la clasificación separa a los líderes en transcripción de las plataformas de agentes.
Un modelo te da texto. Un negocio necesita que se responda la llamada, se resuelva la pregunta y se reserve la cita. Los cinco modelos aquí son el punto de partida adecuado si la transcripción es tu producto, y AssemblyAI, Deepgram, OpenAI y ElevenLabs se ganan cada uno un carril claro.
Si tu objetivo es un agente telefónico que oye, entiende y actúa en un bucle de unos 600 ms, necesitas la capa por encima del modelo. Retell AI ejecuta reconocimiento de voz, el LLM que elijas, una voz ultrarrealista y gestión de turnos propia como un único agente de producción, sin cuotas de plataforma y con 10 $ en créditos gratis.
Empieza a crear hoy tu primer agente de voz con IA gratis.
Elegir un modelo de voz a texto en 2026 se reduce a una pregunta honesta: ¿qué le pasa al texto después de que el modelo lo produce? Si una persona lee la transcripción más tarde, la precisión y el precio deciden el ganador, y a los líderes asíncronos es difícil superarlos. Si una máquina tiene que oír a quien llama, entender la intención y responder antes de que el silencio se vuelva incómodo, entonces el modelo es solo el primer eslabón de una cadena más larga, y la latencia de todo el bucle importa más que cualquier benchmark individual.
Los equipos que entregan productos de voz fiables hacen esa distinción pronto. Prueban con el audio que sus usuarios producen en el mundo real, líneas ruidosas y nombres con acento incluidos, en lugar de con muestras de estudio limpias. Miden la ida y vuelta completa, no la transcripción parcial. Y deciden de antemano si están comprando un componente o un resultado. Acierta con esa decisión y la lista corta se reduce sola. La parte difícil nunca fue el modelo. Era saber para qué trabajo lo contratabas.
¿Qué modelo de voz a texto tiene la tasa de error de palabra más baja en 2026?
AssemblyAI Universal-3 Pro lidera en precisión, reportando una WER media del 5,6 % y registrando los errores más bajos en mi conjunto de llamadas ruidosas, con un 4,7 %. Deepgram Nova-3 le sigue con un 5,26 % en su propio conjunto real, devolviendo las palabras mucho más rápido.
¿Necesito un modelo de voz a texto o una plataforma completa de agente de voz?
Si solo necesitas transcripciones de archivos grabados, un modelo en bruto es más barato y sencillo. Si necesitas un sistema que oiga a quien llama y responda en tiempo real, necesitas la capa por encima del modelo, por eso un reemplazo de IVR con IA ejecuta STT, un LLM, una voz y gestión de turnos juntos.
¿Qué modelo de voz a texto es el más rápido para agentes de voz en directo?
ElevenLabs Scribe v2 Realtime devolvió primeros parciales cerca de los 150 ms en mi prueba, y Deepgram Nova-3 se mantuvo por debajo de los 300 ms hasta el resultado final. Para el bucle completo de oír, decidir y responder, Retell midió unos 600 ms de extremo a extremo, ya que esa cifra incluye el LLM y la respuesta hablada, no solo la transcripción.
¿Cuánto cuestan por minuto los modelos de voz a texto a escala?
Deepgram por lotes cuesta 0,0043 $ por minuto, OpenAI gpt-4o-transcribe cuesta 0,006 $ y AssemblyAI asíncrono cuesta 0,21 $ por hora. Un minuto de agente completo que agrupa STT, LLM, voz y telefonía es una unidad distinta, con un precio en torno a 0,07 $ por minuto.
¿Pueden estos modelos de voz a texto manejar llamadas multilingües y con acento?
OpenAI cubre más de 99 idiomas y ElevenLabs cubre más de 90, lo que los hace los más amplios. AssemblyAI maneja el cambio de código en seis idiomas principales, y la precisión con audio con acento sigue cayendo varios puntos en todos los modelos, así que prueba con tus propios usuarios.
¿Cumplen los modelos de voz a texto con la HIPAA para llamadas sanitarias?
La mayoría de los líderes ofrecen cobertura HIPAA bajo un BAA firmado, incluidos AssemblyAI, Deepgram, ElevenLabs y Retell, este último con SOC 2 Type II y GDPR además. Confirma que el BAA está ejecutado antes de enviar cualquier información sanitaria protegida, y comprueba si la redacción está incluida o se factura aparte. Los detalles de configuración para desarrolladores están en la documentación.
¿Qué pasa cuando un modelo de voz a texto oye mal una palabra crítica?
En un stack de solo transcripción, el error fluye aguas abajo en silencio y corrompe el registro. En un agente, la lógica de recuperación puede reconfirmar un número deletreado o activar una transferencia asistida, por eso los equipos de voz en producción diseñan para el error de reconocimiento en lugar de asumir que el modelo siempre acierta.
Descubre cuánto podría ahorrar tu empresa al pasar a agentes de voz impulsados por IA.
Total Human Agent Cost
AI Agent Cost
Estimated Savings
Un número de teléfono de demostración de Retell Clinic Office

Start building smarter conversations today.




