5 Melhores Modelos de Speech-to-Text em 2026, Testados e Classificados


Rodei cinco modelos de speech-to-text no mesmo conjunto de testes brutal: 40 horas de áudio real de chamadas em 8kHz, incluindo nomes com sotaque, números de apólice soletrados, chamadas em viva-voz de carros em movimento e duas pessoas falando ao mesmo tempo. Medi a taxa de erro de palavras contra minha própria referência, a latência do primeiro parcial e do tempo até o resultado final, e como cada um lidou com as palavras que carregam a transação.
O mercado global de speech-to-text está próximo de US$ 3,87 bilhões em 2026, e a maior parte desse gasto agora flui por um punhado de modelos.
Se você cria produtos de voz, já conhece a armadilha. Sua funcionalidade faz demonstrações limpas no escritório, depois encontra o áudio de produção e destroça a única palavra que importava, então o agente agenda a data errada ou lê de volta a conta errada.
Este guia classifica os modelos que sobrevivem a esse teste, compara precisão, latência, idiomas e preço, e mostra onde cada um conquista seu lugar em uma stack de voz real.
| Funcionalidade | AssemblyAI Universal-3 Pro | Retell AI | Deepgram Nova-3 | OpenAI gpt-4o-transcribe | ElevenLabs Scribe v2 |
|---|---|---|---|---|---|
| Melhor Para | Transcrição assíncrona de máxima precisão | Agentes de voz ativos de ponta a ponta | Streaming de baixa latência em escala | Adequação ao ecossistema multilíngue | Multilíngue em tempo real |
| Preço | US$ 0,21/hora assíncrono | US$ 0,07/min agente completo | US$ 0,0043/min em lote, US$ 0,0077/min stream | US$ 0,006/min, mini US$ 0,003/min | Baseado em uso, ~US$ 0,22/1K tokens |
| Precisão de Transcrição (WER) | 5,6% média, 4,9% mediana | Dependente do motor | 5,26% | ~8,9% independente | Lidera benchmarks multilíngues |
| Latência em Tempo Real | ~760ms tempo até final | ~600ms ida e volta completa | Abaixo de 300ms | 500-1500ms primeiro trecho | ~150ms primeiro parcial |
| STT em Streaming | Sim, Universal-3 RT Pro | Sim, integrado ao agente | Sim, nativo mais Flux | Limitado, via Realtime API | Sim, Scribe v2 Realtime |
| Idiomas | ~20, 6 principais com code-switching | 31+ | ~10 streaming, 36 em lote | 99+ | 90+ |
| Pronto para Agente de Voz | Apenas STT, combine com LLM/TTS | Agente completo com gerenciamento de turnos | STT mais detecção de turno Flux | Fala-para-fala em tempo real | STT mais plataforma Agents |
| Diarização | Sim | Tratada na camada de telefonia | Sim, cobrada à parte | Sim, variante diarize | Sim, 98% de precisão de locutor |
| Conformidade | SOC 2, HIPAA BAA | SOC 2 Type II, HIPAA BAA, GDPR | SOC 2, HIPAA, self-host | SOC 2, opção de retenção zero | SOC 2, ISO 27001, PCI DSS, HIPAA |
| Créditos Grátis | US$ 50 | US$ 10 | US$ 200 | US$ 5 | Camada grátis |
Dados obtidos de páginas oficiais dos produtos e de testes práticos em junho de 2026.
Um modelo de speech-to-text converte áudio falado em texto escrito prevendo a sequência de palavras mais provável a partir de um sinal acústico. A métrica que todos citam é a taxa de erro de palavras, o percentual de palavras substituídas, inseridas ou apagadas em relação a uma referência humana. Modelos neurais agora dominam a categoria, e em atendimento ao cliente e URA eles se tornaram a especificação padrão em vez de um upgrade, uma mudança visível nos dados mais amplos de adoção de voz neural.
O detalhe que confunde os compradores é para que serve o modelo. Um modelo de transcrição retorna texto. Um agente de voz precisa ouvir, entender e responder em tempo real, o que significa que o modelo é uma etapa em um pipeline que também precisa de um LLM, uma voz e gerenciamento de turnos. O primeiro grupo se importa com precisão e preço. O segundo grupo vive ou morre pela latência em todo o ciclo.
Cada modelo abaixo foi avaliado nos mesmos cinco critérios usando o mesmo conjunto de testes. Relato o que medi e onde cada um falhou, não o que as páginas de marketing prometem. A ordem reflete o trabalho que cada ferramenta foi construída para fazer.
O que ele faz? Um modelo de linguagem de fala orientável por prompt que retorna transcrições de alta precisão em áudio ruidoso, com sotaque e técnico.
Para quem é? Equipes cujo produto depende de acertar nomes, números e termos de domínio com exatidão.
| Categoria | Pontuação |
|---|---|
| Precisão de Transcrição | 9,8/10 |
| Latência em Tempo Real | 8,0/10 |
| Suporte Multilíngue | 7,5/10 |
| Prontidão para Produção | 9,0/10 |
| Facilidade de Configuração | 9,0/10 |
| Geral | 9,4/10 |
Alimentei o Universal-3 Pro com um lote de chamadas de cobrança onde os interlocutores soletravam números de conta por cima de ruído de fundo, e ele retornou uma taxa de erro de palavras de 4,7% no meu conjunto, a mais baixa de qualquer modelo que testei. Em uma gravação clínica com nomes de medicamentos e dosagens, seu tratamento médico captou termos que os outros aproximaram, batendo com a taxa de erro de entidade médica de cerca de 4,9% que a AssemblyAI publica contra rivais próximos de 7%.
O que me surpreendeu foi o prompting. Passei contexto em inglês simples antes da transcrição, dizendo para preservar um trecho misto de espanhol e inglês, e ele manteve cada frase em seu idioma original em vez de forçar uma tradução.
Essa precisão em entradas difíceis se alinha com a pesquisa sobre fala com sotaque que mostra o quanto a disfluência e o áudio de não nativos ainda penalizam modelos mais fracos.
O problema é a latência. O Universal-3 Pro é assíncrono em primeiro lugar, e embora o novo RT Pro o leve ao streaming, meu tempo até o final em áudio ao vivo ficou perto de 760ms, mais lento que o Deepgram para um agente de voz de caminho crítico. Para arquivos gravados, podcasts e análise pós-chamada, ele é o líder em precisão.
Prós
Contras
Preço US$ 0,21 por hora para o Universal-3 Pro assíncrono, com descontos por volume e sem limites de taxa. O streaming em tempo real é cobrado à parte no Universal-3 RT Pro.
O que ele faz? Uma plataforma que roda reconhecimento de fala, um LLM, uma voz e gerenciamento de turnos proprietário como um único agente que atende e age em chamadas telefônicas.
Para quem é? Equipes cujo objetivo real é um agente de voz por telefone funcional, não uma transcrição bruta.
| Categoria | Pontuação |
|---|---|
| Precisão de Transcrição | 9,0/10 |
| Latência em Tempo Real | 9,5/10 |
| Suporte Multilíngue | 8,5/10 |
| Prontidão para Produção | 9,5/10 |
| Facilidade de Configuração | 9,5/10 |
| Geral | 9,3/10 |
Parei de testar transcrições aqui e testei resultados. Construí um agente de entrada que rodou um formulário de triagem de quatro perguntas, agendou um horário e registrou cada chamada na análise pós-chamada como uma transcrição pontuada com campos extraídos. A ida e volta completa da fala até a resposta falada mediu cerca de 600ms, rápido o suficiente para que dois interlocutores de teste não percebessem que estavam falando com IA.
A diferença entre isso e uma API de STT bruta apareceu na recuperação e no contexto. Conectar uma base de conhecimento da empresa base de conhecimento permitiu que o agente respondesse perguntas de política sem que eu tivesse que roteirizar cada ramificação, enquanto o gerenciamento de turnos proprietário lidou com a interrupção quando um interlocutor cortou no meio de uma frase.
O modelo ouviu, o sistema decidiu e o agente respondeu antes que a pausa ficasse desconfortável.
Casos extremos que quebram stacks focadas apenas em transcrição foram tratados dentro do fluxo. Quando um interlocutor ficou confuso, o agente disparou uma transferência assistida transferência de chamadas com todo o contexto da conversa em vez de deixá-lo cair. A Medical Data Systems roda isso em 100% das chamadas de entrada com apenas 30% de taxa de transferência, arrecadando cerca de US$ 280.000 por mês.
Prós
Contras
Preço US$ 0,07 por minuto tudo incluído para o agente, sem taxa de plataforma e com US$ 10 em créditos grátis. Esse minuto cobre reconhecimento de fala, o LLM, a voz e a telefonia juntos.
O que ele faz? Um modelo de speech-to-text focado em streaming, projetado para transcrições abaixo de 300ms em áudio ao vivo.
Para quem é? Equipes de engenharia onde a latência é o principal KPI e o volume de chamadas é alto.
| Categoria | Pontuação |
|---|---|
| Precisão de Transcrição | 9,0/10 |
| Latência em Tempo Real | 9,5/10 |
| Suporte Multilíngue | 7,0/10 |
| Prontidão para Produção | 9,0/10 |
| Facilidade de Configuração | 8,5/10 |
| Geral | 9,0/10 |
Transmiti o mesmo áudio de chamada ao vivo para o Nova-3 e consistentemente vi transcrições parciais de volta em menos de 300ms, o resultado de STT puro mais rápido do grupo. Em inglês limpo, ele relatou uma taxa de erro de palavras de 5,26% em seu próprio conjunto do mundo real, e no meu áudio ruidoso ele ficou dentro de dois pontos da AssemblyAI enquanto retornava palavras muito mais cedo.
A cobrança por segundo ajudou em enunciados curtos. Um "alô" de uma palavra foi cobrado como um segundo em vez de um bloco arredondado para cima, o que soma ao longo de chamadas de agente com muita conversa.
A Deepgram também disponibiliza o Flux, um modelo separado com detecção de fim de turno embutida, então não tive que acoplar detecção de atividade de voz para impedir o bot de interromper.
O compromisso é a abrangência. O streaming do Nova-3 cobre cerca de dez idiomas contra a cobertura mais ampla da OpenAI e ElevenLabs, e a diarização é cobrada como adicional. Para um agente de voz focado em inglês que precisa de velocidade acima de tudo, ele é o motor padrão no caminho crítico.
Prós
Contras
Preço US$ 0,0043 por minuto em lote e US$ 0,0077 por minuto em streaming no pagamento conforme o uso, com US$ 200 em créditos grátis. O Flux para agentes de voz começa em US$ 0,0065 por minuto.
O que ele faz? Um modelo de transcrição baseado em GPT-4o que substitui o Whisper legado com taxas de erro mais baixas em mais de 99 idiomas.
Para quem é? Equipes que já constroem na OpenAI e querem um único fornecedor para transcrição e trabalho de LLM.
| Categoria | Pontuação |
|---|---|
| Precisão de Transcrição | 8,7/10 |
| Latência em Tempo Real | 6,5/10 |
| Suporte Multilíngue | 9,0/10 |
| Prontidão para Produção | 8,0/10 |
| Facilidade de Configuração | 9,0/10 |
| Geral | 8,3/10 |
Troquei um pipeline Whisper para o gpt-4o-transcribe mudando uma única string de modelo, e os erros de palavras no meu conjunto multilíngue caíram visivelmente, em linha com os 4,1% relatados pela OpenAI em benchmarks limpos.
No meu áudio de telefonia mais difícil, ele ficou mais perto dos cerca de 8,9% que benchmarks independentes relatam, que é a diferença entre o estúdio e a rua.
A vitória real está nos idiomas e na simplicidade. A US$ 0,006 por minuto, com uma camada mini de US$ 0,003, ele lidou com mais de 99 idiomas sem que eu tivesse que caçar um provedor separado, e a variante diarize rotulou locutores em uma chamada de duas partes dentro de um ou dois pontos de ferramentas feitas para esse fim.
A fraqueza para agentes de voz é o streaming. A transcrição nativa é focada em lote, e tempo real significa migrar para a Realtime API separada, onde meu primeiro trecho de transcrição chegou entre 500 e 1500ms. Para conteúdo multilíngue gravado dentro de uma stack OpenAI, é uma escolha fácil.
Prós
Contras
Preço US$ 0,006 por minuto para o gpt-4o-transcribe, US$ 0,003 para o mini, e cerca de US$ 0,017 por minuto para transcrição em tempo real.
O que ele faz? Um modelo de speech-to-text focado em streaming que entrega transcrições de baixa latência em mais de 90 idiomas.
Para quem é? Criadores que precisam de transcrição rápida e precisa em muitos idiomas para agentes e legendas ao vivo.
| Categoria | Pontuação |
|---|---|
| Precisão de Transcrição | 8,8/10 |
| Latência em Tempo Real | 9,0/10 |
| Suporte Multilíngue | 9,5/10 |
| Prontidão para Produção | 8,0/10 |
| Facilidade de Configuração | 8,5/10 |
| Geral | 8,6/10 |
Transmiti áudio ao vivo para o Scribe v2 Realtime e vi primeiros parciais de volta perto de 150ms, o resultado de primeiro token mais rápido do grupo, com transcrição preditiva antecipando as próximas palavras.
Em uma mistura de clipes em inglês, espanhol e hindi, ele manteve a precisão onde modelos mais fracos derivaram, e detectou automaticamente as trocas de idioma dentro de um único arquivo sem segmentação manual.
A rotulagem de locutor me impressionou em mesas com várias partes, onde ele marcou os turnos com clareza e adicionou timestamps às entidades para redação. O keyterm prompting me permitiu enviesar até 1000 frases em direção a nomes de produtos e medicamentos, o que reduziu erros em termos de marca.
A limitação é a maturidade como espinha dorsal de call center. A diarização em tempo real em áudio não inglês ainda é rústica, e as ferramentas de produção são mais jovens que as da Deepgram. Para transcrição multilíngue em tempo real onde velocidade e abrangência de idiomas importam, ele é o especialista mais forte.
Prós
Contras
Preço Baseado em uso por minuto de áudio, com o Scribe v2 em torno de US$ 0,22 por 1.000 tokens nas camadas de entrada após cortes recentes, além de uma camada grátis para começar.
O WER publicado geralmente vem de gravações limpas, e um modelo em 5% em um benchmark pode chegar a 15-20% em uma chamada ruidosa. Avaliei cada modelo no meu próprio conjunto de chamadas em 8kHz e cruzei com benchmarks independentes para que a classificação reflita a realidade de produção, não um ranking.
Para transcrição, o tempo até o final é o número. Para um agente de voz, o que importa é a ida e volta completa da fala até a resposta falada, porque qualquer coisa acima de um segundo parece um walkie-talkie. Ponderei fortemente a latência de streaming para os casos de uso conversacionais.
Um modelo que vence em inglês pode desabar em chamadas com sotaque ou de idioma misto. Testei áudio em espanhol-inglês e hindi porque a voz neural agora é o padrão em atendimento ao cliente em todo o mercado de reconhecimento de voz, e os interlocutores não permanecem monolíngues.
O critério mais profundo foi o escopo. Um modelo bruto te dá texto e deixa o LLM, a voz e o gerenciamento de turnos por sua conta. Uma plataforma te dá um agente. Avaliei cada ferramenta contra o trabalho para o qual os compradores a contratam, e é por isso que a classificação separa líderes de transcrição de plataformas de agentes.
Um modelo te dá texto. Um negócio precisa da chamada atendida, da pergunta resolvida e do compromisso agendado. Os cinco modelos aqui são o ponto de partida certo se a transcrição é o seu produto, e AssemblyAI, Deepgram, OpenAI e ElevenLabs cada um vence uma faixa clara.
Se o seu objetivo é um agente de voz por telefone que ouve, entende e age em um ciclo de cerca de 600ms, você precisa da camada acima do modelo. A Retell AI roda reconhecimento de fala, o LLM de sua escolha, uma voz ultrarrealista e gerenciamento de turnos proprietário como um único agente de produção, sem taxas de plataforma e com US$ 10 em créditos grátis.
Comece a construir seu primeiro agente de voz com IA grátis hoje.
Escolher um modelo de speech-to-text em 2026 se resume a uma pergunta honesta: o que acontece com o texto depois que o modelo o produz? Se uma pessoa lê a transcrição depois, precisão e preço decidem o vencedor, e os líderes assíncronos são difíceis de superar. Se uma máquina tem que ouvir um interlocutor, entender a intenção e responder antes que o silêncio fique desconfortável, então o modelo é apenas o primeiro elo em uma cadeia mais longa, e a latência em todo o ciclo importa mais que qualquer benchmark único.
As equipes que entregam produtos de voz confiáveis fazem essa distinção cedo. Elas testam no áudio que seus usuários produzem no mundo real, linhas ruidosas e nomes com sotaque incluídos, em vez de amostras limpas de estúdio. Elas medem a ida e volta completa, não a transcrição parcial. E decidem de antemão se estão comprando um componente ou um resultado. Acerte essa decisão e a lista de finalistas se estreita sozinha. A parte difícil nunca foi o modelo. Foi saber para qual trabalho você o estava contratando.
Qual modelo de speech-to-text tem a menor taxa de erro de palavras em 2026?
O AssemblyAI Universal-3 Pro lidera em precisão, relatando um WER médio de 5,6% e registrando os menores erros no meu conjunto de chamadas ruidosas com 4,7%. O Deepgram Nova-3 segue em 5,26% no seu próprio conjunto do mundo real enquanto retorna palavras muito mais rápido.
Preciso de um modelo de speech-to-text ou de uma plataforma completa de agente de voz?
Se você só precisa de transcrições de arquivos gravados, um modelo bruto é mais barato e simples. Se você precisa de um sistema que ouça um interlocutor e responda em tempo real, você precisa da camada acima do modelo, e é por isso que uma substituição de URA com IA roda STT, um LLM, uma voz e gerenciamento de turnos juntos.
Qual modelo de speech-to-text é mais rápido para agentes de voz ativos?
O ElevenLabs Scribe v2 Realtime retornou primeiros parciais perto de 150ms no meu teste, e o Deepgram Nova-3 se manteve abaixo de 300ms de tempo até o final. Para o ciclo completo ouvir-decidir-responder, a Retell mediu cerca de 600ms de ponta a ponta, já que esse número inclui o LLM e a resposta falada, não apenas a transcrição.
Quanto custam os modelos de speech-to-text por minuto em escala?
O Deepgram em lote roda US$ 0,0043 por minuto, o OpenAI gpt-4o-transcribe é US$ 0,006, e o AssemblyAI assíncrono é US$ 0,21 por hora. Um minuto de agente completo que agrupa STT, LLM, voz e telefonia é uma unidade diferente, com preço em torno de US$ 0,07 por minuto.
Esses modelos de speech-to-text conseguem lidar com chamadas multilíngues e com sotaque?
A OpenAI cobre mais de 99 idiomas e a ElevenLabs cobre mais de 90, tornando-as as mais amplas. A AssemblyAI lida com code-switching em seis idiomas principais, e a precisão em áudio com sotaque ainda cai vários pontos para cada modelo, então teste com seus próprios interlocutores.
Os modelos de speech-to-text são compatíveis com HIPAA para chamadas de saúde?
A maioria dos líderes oferece cobertura HIPAA sob um BAA assinado, incluindo AssemblyAI, Deepgram, ElevenLabs e a Retell, esta última que também carrega SOC 2 Type II e GDPR. Confirme que o BAA está executado antes de enviar qualquer informação de saúde protegida, e verifique se a redação está incluída ou cobrada à parte. Os detalhes de configuração para desenvolvedores estão na documentação.
O que acontece quando um modelo de speech-to-text ouve errado uma palavra crítica?
Em uma stack focada apenas em transcrição, o erro flui silenciosamente para baixo e corrompe o registro. Em um agente, a lógica de recuperação pode reconfirmar um número soletrado ou disparar uma transferência assistida, e é por isso que as equipes de voz em produção projetam para o reconhecimento incorreto em vez de assumir que o modelo está sempre certo.
Veja quanto seu negócio poderia economizar ao migrar para agentes de voz com IA.
Total Human Agent Cost
AI Agent Cost
Estimated Savings
Um número de telefone de demonstração do consultório da Retell Clinic

Start building smarter conversations today.




