Benchmark de IA de voz: a Retell fica em 1º lugar em precisão de fluxo no Medicare


Um novo benchmark de IA de voz pegou um agente de seguros do Medicare, colocou-o em seis plataformas diferentes sem mudar uma linha e mediu qual delas realmente seguiu o fluxo de trabalho. A Retell ficou em primeiro lugar.
O teste foi feito pela Cekura, uma empresa independente que cria estruturas de avaliação para agentes de voz. Seu experimento com o Medicare fez 414 chamadas no total e avaliou cada plataforma pela confiabilidade com que conduziu uma conversa regulada de seguros.
A Retell liderou o grupo com 95,7% de precisão de fluxo de trabalho, passando em 22 das 23 verificações. Todas as outras plataformas ficaram entre 65,2% e 95,7%, mesmo rodando o agente idêntico.
Resumo
A Cekura implantou um agente do Medicare byte a byte idêntico em seis plataformas de voz e fez 414 chamadas.
A Retell ficou em 1º lugar com 95,7% de precisão de fluxo de trabalho, passando em 22 dos 23 avaliadores.
As notas do grupo variaram de 65,2% a 95,7%, ou seja, foi a plataforma, e não o agente, que fez a diferença.
A Retell também ficou em primeiro lugar na avaliação rigorosa de ponta a ponta, que considera falhas de execução, novamente com 95,7%.
Em uma chamada regulada do Medicare, essa diferença é o que separa uma transferência em conformidade de uma chamada perdida ou fora das regras.
A Cekura criou um agente TPMO do Medicare e implantou uma cópia byte a byte idêntica em cada uma das seis plataformas. Mesmo prompt, mesmas ferramentas, mesma voz. A única variável era a plataforma rodando por baixo.
Um TPMO é uma organização de marketing terceirizada, o tipo de agência licenciada que vende planos Medicare Advantage e Part D. Essas chamadas são fortemente reguladas, então o agente precisa acertar muita coisa, e em uma ordem fixa.
O benchmark usou 23 avaliadores, cada um focado em um ponto onde as chamadas de seguros costumam falhar. Eles se dividiam em quatro grupos: abrir a chamada e obter permissão, entender o que a pessoa realmente precisa, qualificar e registrar o lead, e permanecer dentro dos limites de proteção ao consumidor.
Cada avaliador foi executado três vezes em cada plataforma, e a plataforma só recebia crédito se as três execuções passassem, uma métrica que a Cekura chama de pass^3. Vinte e três avaliadores, três execuções cada, em seis plataformas resultam nas 414 chamadas. Você pode ler a metodologia e as execuções por plataforma na página de benchmark da Cekura.
Veja como as seis plataformas pontuaram, em ordem de precisão de fluxo de trabalho:
| Plataforma | Fluxo de trabalho pass^3 | Ponta a ponta rigoroso pass^3 |
|---|---|---|
| Retell | 95,7% (22/23) | 95,7% (22/23) |
| ElevenLabs | 91,3% (21/23) | 91,3% (21/23) |
| Pipecat | 82,6% (19/23) | 73,9% (17/23) |
| LiveKit | 73,9% (17/23) | 73,9% (17/23) |
| Synthflow | 69,6% (16/23) | 8,7% (2/23) |
| Vapi | 65,2% (15/23) | 65,2% (15/23) |
A Retell foi a única plataforma a passar de 95% em precisão de fluxo de trabalho, e manteve essa nota na métrica mais rigorosa explicada abaixo.
A Cekura divulgou duas notas porque um agente de voz pode falhar de duas maneiras diferentes.
O pass^3 de fluxo de trabalho pergunta se o agente escolheu a ação certa e chamou suas ferramentas corretamente. Usa dois sinais que a Cekura chama de Expected Outcome e Mock Tool Accuracy.
O pass^3 rigoroso de ponta a ponta acrescenta uma segunda pergunta: a pessoa realmente conseguiu concluir a tarefa? Ele considera falhas de infraestrutura, como o agente travar no meio da chamada, que impedem a conclusão mesmo quando a ação pretendida estava correta.
A Retell marcou 95,7% nas duas, ou seja, não perdeu terreno por problemas de execução. Algumas plataformas perderam. A Synthflow passou em 16 dos 23 avaliadores em precisão de fluxo de trabalho, mas em apenas 2 de 23 na avaliação rigorosa, porque durante o uso de ferramentas as pessoas frequentemente enfrentavam longos silêncios sem nenhum sinal de que o agente ainda estava trabalhando.
Em uma chamada de vendas do Medicare, o agente não está apenas respondendo perguntas. Ele precisa fazer a divulgação obrigatória, obter consentimento antes de falar sobre planos, evitar dar conselhos personalizados e encaminhar a pessoa a um humano licenciado no momento certo.
Essas etapas são definidas por regras federais de TPMO, e pular uma delas é um problema de conformidade, não um detalhe.
Foi isso que os 23 avaliadores testaram. Uma pessoa interrompe a divulgação e exige detalhes do plano. Um familiar liga em nome de um beneficiário. Alguém pede que o agente garanta que um plano cobre seu medicamento. A atitude correta em cada caso é específica, e uma plataforma que trava ou improvisa falha com a pessoa e com o registro de conformidade ao mesmo tempo.
O benchmark mostra que rodar o mesmo agente não é suficiente. A plataforma por baixo decide se esse agente se sustenta nas chamadas de maior risco.
A Retell é uma plataforma para criar, testar, implantar e monitorar agentes de voz com IA que fazem e recebem chamadas telefônicas. O benchmark premiou duas coisas em torno das quais a Retell foi construída: seguir um fluxo de trabalho de várias etapas e chamar ferramentas corretamente sob pressão.
Transferência assistida para um humano licenciado: quando a pessoa precisa falar com alguém, o agente faz a passagem com o contexto que já coletou, usando transferência de chamadas.
Respostas de uma base de conhecimento, não conselhos fora do roteiro: o agente busca respostas factuais em uma base de conhecimento conectada e permanece dentro do que pode dizer.
Cada chamada revisada depois: as equipes usam análise pós-chamada e garantia de qualidade com IA para ver onde um fluxo se sustentou e onde falhou.
Feita para setores regulados: a Retell opera agentes de voz para equipes de saúde e seguros, onde a ordem das etapas em uma chamada não é opcional.
Este é um teste independente sobre um fluxo de trabalho, e os resultados variam conforme a forma como um agente é criado e mantido. Ainda assim, em uma tarefa difícil e regulada, a Retell saiu à frente do grupo.
Um benchmark de IA de voz é um teste controlado que executa a mesma tarefa em diferentes plataformas de agentes de voz e avalia o desempenho de cada uma. A versão da Cekura usa chamadas repetidas e avaliadores fixos para manter a comparação justa.
A Cekura, uma empresa independente que cria ferramentas de avaliação para agentes de voz. A Retell não conduziu o teste nem avaliou a si mesma.
A plataforma tinha que passar em um avaliador em três execuções separadas para receber o crédito. Uma execução de sorte não conta, o que torna a nota um teste de consistência, e não de uma única chamada boa.
Sim. A Cekura implantou um agente do Medicare byte a byte idêntico nas seis plataformas, com o mesmo prompt, ferramentas e voz, então qualquer diferença de nota vem da plataforma, não do agente.
A Cekura publica as execuções por plataforma e a metodologia completa em sua página de benchmark, incluindo o detalhamento de cada avaliador no experimento do Medicare.
Crie um agente de voz que se sustenta nas chamadas difíceis.
A Retell permite criar, testar e lançar um agente de voz com IA e acompanhar seu desempenho em cada chamada. Teste a Retell gratuitamente ou fale com vendas.
Veja quanto seu negócio poderia economizar ao migrar para agentes de voz com IA.
Total Human Agent Cost
AI Agent Cost
Estimated Savings
Um número de telefone de demonstração do consultório da Retell Clinic

Start building smarter conversations today.

