Benchmark de IA de voz: Retell es la n.º 1 en precisión de flujos de Medicare


Un nuevo benchmark de IA de voz tomó un agente de seguros de Medicare, lo puso en seis plataformas distintas sin cambiar una sola línea y midió cuál seguía realmente el flujo de trabajo. Retell quedó en primer lugar.
La prueba la realizó Cekura, una empresa independiente que crea entornos de evaluación para agentes de voz. Su experimento con Medicare realizó 414 llamadas en total y puntuó cada plataforma según la fiabilidad con la que gestionaba una conversación de seguros regulada.
Retell lideró el grupo con un 95,7 % de precisión en el flujo de trabajo, superando 22 de las 23 comprobaciones. El resto de plataformas se situó entre el 65,2 % y el 95,7 %, aunque todas ejecutaban el mismo agente idéntico.
En resumen
Cekura desplegó un único agente de Medicare idéntico byte a byte en seis plataformas de voz y realizó 414 llamadas.
Retell quedó la n.º 1 con un 95,7 % de precisión en el flujo de trabajo, superando 22 de 23 evaluadores.
Las puntuaciones del grupo fueron del 65,2 % al 95,7 %, así que la diferencia la marcó la plataforma, no el agente.
Retell también mantuvo el primer puesto con la evaluación estricta de extremo a extremo, que cuenta los fallos en tiempo de ejecución, de nuevo con un 95,7 %.
En una llamada regulada de Medicare, esa diferencia es la que separa una transferencia conforme a la normativa de una llamada cortada o no conforme.
Cekura creó un agente TPMO de Medicare y desplegó una copia idéntica byte a byte en cada una de las seis plataformas. El mismo prompt, las mismas herramientas, la misma voz. La única variable era la plataforma que lo ejecutaba por debajo.
Una TPMO es una organización de marketing externa, el tipo de agencia autorizada que vende planes Medicare Advantage y Part D. Estas llamadas están muy reguladas, así que el agente tiene que acertar en muchas cosas, y en un orden fijo.
El benchmark utilizó 23 evaluadores, cada uno centrado en un punto donde las llamadas de seguros suelen fallar. Se agrupaban en cuatro bloques: abrir la llamada y obtener permiso, averiguar qué necesita realmente la persona que llama, cualificar y registrar el lead, y mantenerse dentro de los límites de protección al consumidor.
Cada evaluador se ejecutó tres veces en cada plataforma, y una plataforma solo obtenía el punto si las tres ejecuciones pasaban, una medida que Cekura llama pass^3. Veintitrés evaluadores, tres ejecuciones cada uno, en seis plataformas dan las 414 llamadas completas. Puedes consultar la metodología y las ejecuciones por plataforma en la página de benchmarks de Cekura.
Así puntuaron las seis plataformas, ordenadas por precisión en el flujo de trabajo:
| Plataforma | Flujo de trabajo pass^3 | Extremo a extremo estricto pass^3 |
|---|---|---|
| Retell | 95,7 % (22/23) | 95,7 % (22/23) |
| ElevenLabs | 91,3 % (21/23) | 91,3 % (21/23) |
| Pipecat | 82,6 % (19/23) | 73,9 % (17/23) |
| LiveKit | 73,9 % (17/23) | 73,9 % (17/23) |
| Synthflow | 69,6 % (16/23) | 8,7 % (2/23) |
| Vapi | 65,2 % (15/23) | 65,2 % (15/23) |
Retell fue la única plataforma que superó el 95 % en precisión de flujo de trabajo, y mantuvo esa puntuación con la medida más estricta que se explica a continuación.
Cekura publicó dos puntuaciones porque un agente de voz puede fallar de dos maneras distintas.
El pass^3 de flujo de trabajo pregunta si el agente eligió la acción correcta y llamó bien a sus herramientas. Utiliza dos señales que Cekura denomina Expected Outcome y Mock Tool Accuracy.
El pass^3 estricto de extremo a extremo añade una segunda pregunta: ¿consiguió realmente la persona que llamaba completar la tarea? Cuenta los fallos de infraestructura, como que el agente se quede bloqueado a mitad de la llamada, que impiden terminar aunque la acción prevista fuera la correcta.
Retell obtuvo un 95,7 % en ambas, así que no perdió terreno por problemas en tiempo de ejecución. Otras plataformas sí. Synthflow superó 16 de 23 evaluadores en precisión de flujo de trabajo, pero solo 2 de 23 con la evaluación estricta, porque durante el uso de herramientas quienes llamaban aguantaban largos silencios sin ninguna señal de que el agente siguiera trabajando.
En una llamada de venta de Medicare, el agente no solo responde preguntas. Tiene que dar la información obligatoria, obtener el consentimiento antes de hablar de planes, evitar dar asesoramiento personalizado y derivar a la persona a un humano autorizado en el momento adecuado.
Esos pasos los fijan las normas federales para TPMO, y saltarse uno es un problema de cumplimiento normativo, no un detalle menor.
Eso es lo que probaron los 23 evaluadores. Alguien interrumpe la información obligatoria y exige detalles del plan. Un familiar llama en nombre de un beneficiario. Alguien pide al agente que le prometa que un plan cubre su medicación. La respuesta correcta en cada caso es concreta, y una plataforma que se bloquea o improvisa falla a la vez a la persona que llama y al registro de cumplimiento.
El benchmark demuestra que ejecutar el mismo agente no basta. La plataforma que está por debajo decide si ese agente aguanta en las llamadas de mayor riesgo.
Retell es una plataforma para crear, probar, desplegar y monitorizar agentes de voz con IA que hacen y reciben llamadas telefónicas. El benchmark premió dos cosas sobre las que está construida Retell: seguir un flujo de trabajo de varios pasos y llamar correctamente a las herramientas bajo presión.
Transferencia asistida a un humano autorizado: cuando alguien necesita hablar con una persona, el agente hace la transferencia con el contexto que ya ha recogido, mediante la transferencia de llamadas.
Respuestas desde una base de conocimiento, no consejos fuera de guion: el agente extrae respuestas objetivas de una base de conocimiento conectada y se mantiene dentro de lo que tiene permitido decir.
Todas las llamadas revisadas después: los equipos usan el análisis posterior a la llamada y la garantía de calidad con IA para ver dónde funcionó el flujo y dónde falló.
Diseñada para sectores regulados: Retell ejecuta agentes de voz para equipos de sanidad y seguros, donde el orden de las operaciones en una llamada no es opcional.
Se trata de una prueba independiente sobre un único flujo de trabajo, y los resultados varían según cómo se construya y mantenga un agente. Aun así, en una tarea difícil y regulada, Retell se situó por delante del resto.
Un benchmark de IA de voz es una prueba controlada que ejecuta la misma tarea en distintas plataformas de agentes de voz y puntúa lo bien que la gestiona cada una. La versión de Cekura usa llamadas repetidas y evaluadores fijos para que la comparación sea justa.
Cekura, una empresa independiente que crea herramientas de evaluación para agentes de voz. Retell no realizó la prueba ni se puntuó a sí misma.
Una plataforma tenía que superar un evaluador en tres ejecuciones distintas para obtener el punto. Una ejecución afortunada no cuenta, lo que convierte la puntuación en una prueba de consistencia y no en una sola llamada buena.
Sí. Cekura desplegó un agente de Medicare idéntico byte a byte en las seis plataformas, con el mismo prompt, herramientas y voz, así que cualquier diferencia de puntuación viene de la plataforma, no del agente.
Cekura publica las ejecuciones por plataforma y la metodología completa en su página de benchmarks, incluido el desglose de cada evaluador del experimento de Medicare.
Crea un agente de voz que aguante en las llamadas difíciles.
Retell te permite crear, probar y lanzar un agente de voz con IA, y después ver cómo rinde en cada llamada. Prueba Retell gratis o habla con ventas.
Descubre cuánto podría ahorrar tu empresa al pasar a agentes de voz impulsados por IA.
Total Human Agent Cost
AI Agent Cost
Estimated Savings
Un número de teléfono de demostración de Retell Clinic Office

Start building smarter conversations today.

