Benchmark de IA de voz: Retell es la n.º 1 en precisión de flujos de Medicare

Benchmark de IA de voz: Retell es la n.º 1 en precisión de flujos de Medicare
VOLVER A LOS BLOGS
Add Retell AI as a preferred source on Google
EN ESTA PÁGINA
Volver arriba

Un nuevo benchmark de IA de voz tomó un agente de seguros de Medicare, lo puso en seis plataformas distintas sin cambiar una sola línea y midió cuál seguía realmente el flujo de trabajo. Retell quedó en primer lugar.

La prueba la realizó Cekura, una empresa independiente que crea entornos de evaluación para agentes de voz. Su experimento con Medicare realizó 414 llamadas en total y puntuó cada plataforma según la fiabilidad con la que gestionaba una conversación de seguros regulada.

Retell lideró el grupo con un 95,7 % de precisión en el flujo de trabajo, superando 22 de las 23 comprobaciones. El resto de plataformas se situó entre el 65,2 % y el 95,7 %, aunque todas ejecutaban el mismo agente idéntico.

En resumen

  • Cekura desplegó un único agente de Medicare idéntico byte a byte en seis plataformas de voz y realizó 414 llamadas.

  • Retell quedó la n.º 1 con un 95,7 % de precisión en el flujo de trabajo, superando 22 de 23 evaluadores.

  • Las puntuaciones del grupo fueron del 65,2 % al 95,7 %, así que la diferencia la marcó la plataforma, no el agente.

  • Retell también mantuvo el primer puesto con la evaluación estricta de extremo a extremo, que cuenta los fallos en tiempo de ejecución, de nuevo con un 95,7 %.

  • En una llamada regulada de Medicare, esa diferencia es la que separa una transferencia conforme a la normativa de una llamada cortada o no conforme.

Qué puso a prueba el benchmark de IA de voz de Cekura

Cekura creó un agente TPMO de Medicare y desplegó una copia idéntica byte a byte en cada una de las seis plataformas. El mismo prompt, las mismas herramientas, la misma voz. La única variable era la plataforma que lo ejecutaba por debajo.

Una TPMO es una organización de marketing externa, el tipo de agencia autorizada que vende planes Medicare Advantage y Part D. Estas llamadas están muy reguladas, así que el agente tiene que acertar en muchas cosas, y en un orden fijo.

El benchmark utilizó 23 evaluadores, cada uno centrado en un punto donde las llamadas de seguros suelen fallar. Se agrupaban en cuatro bloques: abrir la llamada y obtener permiso, averiguar qué necesita realmente la persona que llama, cualificar y registrar el lead, y mantenerse dentro de los límites de protección al consumidor.

Cada evaluador se ejecutó tres veces en cada plataforma, y una plataforma solo obtenía el punto si las tres ejecuciones pasaban, una medida que Cekura llama pass^3. Veintitrés evaluadores, tres ejecuciones cada uno, en seis plataformas dan las 414 llamadas completas. Puedes consultar la metodología y las ejecuciones por plataforma en la página de benchmarks de Cekura.

Los resultados: Retell, la n.º 1 con un 95,7 %

Así puntuaron las seis plataformas, ordenadas por precisión en el flujo de trabajo:

PlataformaFlujo de trabajo pass^3Extremo a extremo estricto pass^3
Retell95,7 % (22/23)95,7 % (22/23)
ElevenLabs91,3 % (21/23)91,3 % (21/23)
Pipecat82,6 % (19/23)73,9 % (17/23)
LiveKit73,9 % (17/23)73,9 % (17/23)
Synthflow69,6 % (16/23)8,7 % (2/23)
Vapi65,2 % (15/23)65,2 % (15/23)

Retell fue la única plataforma que superó el 95 % en precisión de flujo de trabajo, y mantuvo esa puntuación con la medida más estricta que se explica a continuación.

Dos formas de medir la fiabilidad

Cekura publicó dos puntuaciones porque un agente de voz puede fallar de dos maneras distintas.

El pass^3 de flujo de trabajo pregunta si el agente eligió la acción correcta y llamó bien a sus herramientas. Utiliza dos señales que Cekura denomina Expected Outcome y Mock Tool Accuracy.

El pass^3 estricto de extremo a extremo añade una segunda pregunta: ¿consiguió realmente la persona que llamaba completar la tarea? Cuenta los fallos de infraestructura, como que el agente se quede bloqueado a mitad de la llamada, que impiden terminar aunque la acción prevista fuera la correcta.

Retell obtuvo un 95,7 % en ambas, así que no perdió terreno por problemas en tiempo de ejecución. Otras plataformas sí. Synthflow superó 16 de 23 evaluadores en precisión de flujo de trabajo, pero solo 2 de 23 con la evaluación estricta, porque durante el uso de herramientas quienes llamaban aguantaban largos silencios sin ninguna señal de que el agente siguiera trabajando.

Por qué la precisión del flujo de trabajo importa en las llamadas de Medicare

En una llamada de venta de Medicare, el agente no solo responde preguntas. Tiene que dar la información obligatoria, obtener el consentimiento antes de hablar de planes, evitar dar asesoramiento personalizado y derivar a la persona a un humano autorizado en el momento adecuado.

Esos pasos los fijan las normas federales para TPMO, y saltarse uno es un problema de cumplimiento normativo, no un detalle menor.

Eso es lo que probaron los 23 evaluadores. Alguien interrumpe la información obligatoria y exige detalles del plan. Un familiar llama en nombre de un beneficiario. Alguien pide al agente que le prometa que un plan cubre su medicación. La respuesta correcta en cada caso es concreta, y una plataforma que se bloquea o improvisa falla a la vez a la persona que llama y al registro de cumplimiento.

El benchmark demuestra que ejecutar el mismo agente no basta. La plataforma que está por debajo decide si ese agente aguanta en las llamadas de mayor riesgo.

Dónde encaja Retell

Retell es una plataforma para crear, probar, desplegar y monitorizar agentes de voz con IA que hacen y reciben llamadas telefónicas. El benchmark premió dos cosas sobre las que está construida Retell: seguir un flujo de trabajo de varios pasos y llamar correctamente a las herramientas bajo presión.

  • Transferencia asistida a un humano autorizado: cuando alguien necesita hablar con una persona, el agente hace la transferencia con el contexto que ya ha recogido, mediante la transferencia de llamadas.

  • Respuestas desde una base de conocimiento, no consejos fuera de guion: el agente extrae respuestas objetivas de una base de conocimiento conectada y se mantiene dentro de lo que tiene permitido decir.

  • Todas las llamadas revisadas después: los equipos usan el análisis posterior a la llamada y la garantía de calidad con IA para ver dónde funcionó el flujo y dónde falló.

  • Diseñada para sectores regulados: Retell ejecuta agentes de voz para equipos de sanidad y seguros, donde el orden de las operaciones en una llamada no es opcional.

Se trata de una prueba independiente sobre un único flujo de trabajo, y los resultados varían según cómo se construya y mantenga un agente. Aun así, en una tarea difícil y regulada, Retell se situó por delante del resto.

Preguntas frecuentes

¿Qué es un benchmark de IA de voz?

Un benchmark de IA de voz es una prueba controlada que ejecuta la misma tarea en distintas plataformas de agentes de voz y puntúa lo bien que la gestiona cada una. La versión de Cekura usa llamadas repetidas y evaluadores fijos para que la comparación sea justa.

¿Quién realizó este benchmark?

Cekura, una empresa independiente que crea herramientas de evaluación para agentes de voz. Retell no realizó la prueba ni se puntuó a sí misma.

¿Qué significa pass^3?

Una plataforma tenía que superar un evaluador en tres ejecuciones distintas para obtener el punto. Una ejecución afortunada no cuenta, lo que convierte la puntuación en una prueba de consistencia y no en una sola llamada buena.

¿Todas las plataformas ejecutaron el mismo agente?

Sí. Cekura desplegó un agente de Medicare idéntico byte a byte en las seis plataformas, con el mismo prompt, herramientas y voz, así que cualquier diferencia de puntuación viene de la plataforma, no del agente.

¿Dónde puedo ver los resultados completos?

Cekura publica las ejecuciones por plataforma y la metodología completa en su página de benchmarks, incluido el desglose de cada evaluador del experimento de Medicare.

Crea un agente de voz que aguante en las llamadas difíciles.

Retell te permite crear, probar y lanzar un agente de voz con IA, y después ver cómo rinde en cada llamada. Prueba Retell gratis o habla con ventas.

Calculadora de ROI
Estima tu ROI al automatizar las llamadas

Descubre cuánto podría ahorrar tu empresa al pasar a agentes de voz impulsados por IA.

¡Listo! 
Tu envío se ha mandado a tu correo electrónico
¡Vaya! Algo salió mal al enviar el formulario.
   1
   8
20
¡Vaya! Algo salió mal al enviar el formulario.

Resultado del ROI

2,000

Total Human Agent Cost

$5,000
/month

AI Agent Cost

$3,000
/month

Estimated Savings

$2,000
/month
Demo en Directo
Prueba Nuestra Demo en Directo

Un número de teléfono de demostración de Retell Clinic Office

¡Gracias! ¡Tu envío ha sido recibido!
¡Vaya! Algo salió mal al enviar el formulario.

Read Other Blogs

Revolutionize your call operation with Retell