Presentamos vCX-Hard, un benchmark de Retell que clasifica los modelos líderes en llamadas reales de centros de contacto, midiendo dos capacidades que determinan si un agente de voz tiene éxito: mantenerse anclado en la verdad y emprender la acción correcta. Construido a partir de datos propios de llamadas en producción, vCX-Hard evalúa el rendimiento de los modelos donde más importa. Incluso el mejor modelo de hoy solo alcanza alrededor del 88 % en los turnos más difíciles, y por eso precisamente importa la elección del modelo.
Los clientes nos hacen una pregunta más que ninguna otra: ¿qué modelo debería usar para mi agente de voz? Durante mucho tiempo la respuesta interna honesta fue un nombre y un encogimiento de hombros. Para una plataforma que gestiona millones de llamadas reales de clientes, eso no es suficiente.
Un agente de centro de llamadas vive o muere por dos habilidades, y solo dos:
Los benchmarks públicos rara vez prueban ambas cosas a la vez, y casi nunca en las condiciones de una llamada telefónica en directo. Los datos que pueden hacerlo son difíciles de conseguir. Los propios registros de llamadas de una sola empresa no son lo bastante diversos para clasificar modelos con confianza. Retell dispone de tráfico de producción real y diverso de muchos sectores y despliegues, al volumen necesario para separar un modelo de otro. Ese es el único ingrediente que necesita un benchmark fiable de centro de llamadas, y es el que la mayoría de los equipos no puede reunir.
El nombre dice lo que es. La v minúscula es por voice (voz). CX es customer experience (experiencia del cliente), el trabajo cotidiano de un agente de centro de llamadas. Hard es el método: solo puntuamos los turnos más difíciles del tráfico de producción real, los momentos en los que los modelos realmente se distancian. En la distribución completa de las llamadas de producción, la mayoría de los modelos de frontera ya superan el 90 por ciento, lo que no dice nada útil. La porción difícil es donde un benchmark se gana el sueldo.
Cada caso se extrae de llamadas de producción reales, no escritas a mano ni generadas sintéticamente. Puntuamos los modelos en los dos ejes que deciden una llamada:
Evaluamos 50 configuraciones que abarcan 27 modelos. Como los agentes de voz en producción funcionan con el razonamiento desactivado, por la latencia, reportamos dos vistas en todo momento: producción (razonamiento desactivado, lo que se ejecuta en llamadas en directo) y mejor (razonamiento medio, un techo de cuánto aportaría el razonamiento). GPT-5.5 lidera ambas, alcanzando un 84,8 por ciento de no alucinación en producción y un 88,0 por ciento en su mejor caso. Ningún modelo está cerca de resolverlo, que es exactamente la cuestión.
Muestreamos tráfico de llamadas de producción entre el 6 de febrero y el 1 de mayo de 2026, en ventanas de 30 minutos aproximadamente cada 15 días, extraídas de organizaciones con más de 1.000 llamadas en los tres meses anteriores. Crucialmente, muestreamos a nivel de organización, de modo que unas pocas organizaciones de alto volumen no dominen el conjunto. Eso es lo que mantiene la distribución amplia a lo largo de despliegues reales en lugar de sesgada hacia un único cliente.
De ese tráfico seleccionamos dos conjuntos de casos difíciles: un conjunto de alucinación de 2.075 casos y un conjunto de llamadas a herramientas de 1.514 casos. Cada caso se extrae mediante un pipeline de varias etapas. Preclasificadores ligeros marcan los turnos candidatos (afirmaciones numéricas, momentos previos a una transferencia, errores de herramientas, llamadas repetidas o ausentes), un clasificador LLM confirma después si se produjo un fallo real y etiqueta su categoría y gravedad, una segunda pasada vuelve a revisar el turno concreto y, por último, se genera una solución de referencia correcta para la puntuación.
La propia taxonomía de fallos es informativa. En el lado de la alucinación, el problema dominante no es exótico. Los agentes fabrican o tergiversan las políticas mucho más que cualquier otra cosa.

Los fallos de llamadas a herramientas se agrupan igual de estrechamente. De 1.514 casos, las dos categorías más grandes son omitir una llamada necesaria (897) y disparar una innecesaria (520). La selección de la herramienta equivocada es casi inexistente (2 casos). Dicho de otro modo, los modelos rara vez eligen la herramienta equivocada. Fallan en el juicio: en saber cuándo actuar y cuándo esperar.
La puntuación utiliza un consejo de LLM: un panel de modelos de frontera líderes que puntúa cada caso frente a una rúbrica descriptiva y una solución de referencia generada. Usar varios jueces sólidos en lugar de uno evita que la evaluación herede los puntos ciegos de un único modelo, y los desacuerdos se concilian dentro del panel.
Como las puntuaciones absolutas varían con la rúbrica y los jueces, tratamos la clasificación, no el número exacto, como la señal.
La puntuación máxima ronda el 88 por ciento, y eso es intencionado. Si puntuáramos sobre la distribución completa de producción, casi todos los modelos de frontera quedarían por encima del 90 por ciento y la clasificación no diría nada. Las llamadas fáciles son fáciles para todos.
Por eso vCX-Hard se construye a partir de los turnos más difíciles, los momentos en los que los modelos realmente divergen. Así funciona todo benchmark serio. Un benchmark de matemáticas usa problemas de competición, no la aritmética que un usuario típico teclea. El objetivo no es un número halagador. El objetivo es un número que puedas comparar entre modelos, y a lo largo del tiempo a medida que se lanzan nuevos modelos.
Mostramos cada clasificación de dos maneras: producción, con el razonamiento desactivado, que es lo que se ejecuta en llamadas en directo, y mejor, cada modelo en su ajuste de razonamiento más fuerte, que muestra el techo. En no alucinación, GPT-5.5 lidera ambas. En producción, la línea GPT-5 y gemini-3.1-pro se sitúan en lo más alto; activar el razonamiento eleva los mismos nombres unos puntos y reordena la persecución por detrás de ellos.

La corrección de llamadas a herramientas es donde más divergen las dos vistas. Con el razonamiento activado, GPT-5.5 lidera. Pero en producción, donde realmente se ejecuta, las llamadas a herramientas de GPT-5.5 caen del 88,3 al 75,6 por ciento, y gemini-3.1-pro se convierte en el mejor llamador de herramientas por un margen claro, manteniendo un 85,7 por ciento con el razonamiento desactivado. Si tu agente funciona con el razonamiento desactivado, el modelo más fuerte no es el mismo.

Tres patrones destacan en todo el conjunto.
1. El razonamiento es la diferencia entre las dos vistas. Activar el razonamiento eleva las puntuaciones en casi todos los modelos, en torno a 5 puntos de media en no alucinación. GPT-5.5 sube del 84,8 al 88,0 por ciento una vez que razona antes de hablar. El coste es la latencia, razón por la que la mayoría de los agentes de producción lo dejan desactivado, y por la que la vista de producción es la que conviene planificar.

2. El anclaje y la acción son habilidades distintas. Los dos ejes no se clasifican igual. Un modelo fuerte en anclaje puede ser mediocre en llamadas a herramientas, y al revés. GPT-5.4 se sitúa cerca de lo más alto en anclaje pero fuera de los diez primeros en llamadas a herramientas, mientras que claude-4.5-sonnet es lo contrario. Elegir un modelo es en realidad una cuestión de qué fallo pueden permitirse menos tus clientes.
3. Ningún modelo es seguro todavía. Incluso en su mejor caso, el líder aún falla alrededor de uno de cada ocho de los turnos más difíciles en cada eje, y en producción falla más. La diferencia entre una puntuación de benchmark y un despliegue en el que puedas confiar es exactamente el trabajo que la plataforma realiza sobre el modelo.
Mirando a través de las generaciones de modelos, la frontera se mueve en la dirección correcta. De GPT-4o a GPT-5.5, la no alucinación subió del 72,8 al 88,0 por ciento, con las llamadas a herramientas mejorando en una trayectoria similar.

Producción (razonamiento desactivado, lo que se ejecuta en directo) y mejor (ajuste de razonamiento más fuerte) para cada modelo, ordenados por la no alucinación en producción. Más alto es mejor.
| Modelo | No alucinación % | Llamadas a herramientas % | ||
|---|---|---|---|---|
| Prod (razonamiento desactivado) | Mejor (con razonamiento) | Prod (razonamiento desactivado) | Mejor (con razonamiento) | |
| gpt-5.5 | 84,8% | 88,0% | 75,6% | 88,3% |
| gpt-5.4 | 83,0% | 83,3% | 75,2% | 77,4% |
| gemini-3.1-pro | 82,6% | 83,6% | 85,7% | 85,9% |
| gpt-5.2 | 81,3% | 81,6% | 79,6% | 81,5% |
| claude-4.6-sonnet | 81,2% | 81,6% | 80,1% | 80,4% |
| glm-5.1 | 79,3% | 82,7% | 77,3% | 83,8% |
| gpt-5.1 | 75,7% | 81,0% | 78,2% | 83,7% |
| gemini-3.1-flash-lite | 74,4% | 77,7% | 69,0% | 75,8% |
| gemini-3-flash | 73,8% | 80,1% | 71,2% | 81,8% |
| gpt-4o | 72,8% | 72,8% | 63,6% | 63,6% |
| claude-4.5-haiku | 72,4% | 78,7% | 70,7% | 79,4% |
| gemini-2.5-pro | 72,3% | 77,2% | 72,9% | 80,6% |
| gemini-3.5-flash | 72,0% | 80,7% | 69,2% | 84,0% |
| claude-4.5-sonnet | 71,5% | 80,6% | 77,5% | 85,8% |
| gpt-4.1 | 71,5% | 71,5% | 62,2% | 62,2% |
| gpt-5 | 71,2% | 78,8% | 68,9% | 83,2% |
| gpt-5.4-mini | 70,7% | 71,3% | 57,1% | 60,2% |
| gpt-5-mini | 69,4% | 75,2% | 70,6% | 75,6% |
| o4-mini | 67,9% | 67,9% | 73,9% | 73,9% |
| gpt-5.4-nano | 66,2% | 66,3% | 57,5% | 59,1% |
| grok-4.3 | 65,8% | 76,3% | 54,6% | 72,1% |
| kimi-k2.6 | 63,5% | 63,5% | 66,3% | 66,3% |
| o3-mini | 62,7% | 62,7% | 59,0% | 59,0% |
| gemini-2.5-flash-lite | 59,8% | 75,2% | 47,0% | 70,3% |
| mercury-2 | 56,7% | 61,9% | 52,2% | 55,9% |
| gpt-5-nano | 53,9% | 57,6% | 54,5% | 56,1% |
| deepseek-v4-pro | 49,8% | 55,6% | 58,9% | 64,5% |
Prod es cada modelo con el razonamiento desactivado, o su ajuste más bajo disponible. Mejor es su ajuste de razonamiento más fuerte. Los modelos con columnas coincidentes (gpt-4o, gpt-4.1, kimi-k2.6, o4-mini, o3-mini) tuvieron un único ajuste evaluado.
Un benchmark solo es útil si cambia cómo construyes. Las brechas que vCX-Hard expone se corresponden directamente con funciones de la plataforma de Retell, para que no tengas que implementarlas tú.
La elección del modelo es el primer paso. La plataforma que rodea al modelo es lo que convierte una puntuación de benchmark en un despliegue en el que puedes confiar.
vCX-Hard es una versión temprana y tiene límites reales. La puntuación descansa en un panel de jueces LLM, que arrastra sus propios sesgos. Los casos se extraen por su dificultad, así que las puntuaciones reflejan los turnos más difíciles en lugar de la calidad media de las llamadas. Y el benchmark mide dos modos de fallo específicos, no la experiencia completa de una llamada, como el tono, la latencia o la gestión de interrupciones.
Mantendremos vCX-Hard actualizado a medida que se lancen nuevos modelos. Cada lanzamiento desata la misma pregunta en todos los equipos que ejecutan agentes de voz: ha salido un nuevo modelo, ¿cambiamos? vCX-Hard está hecho para responder a eso con datos actuales en lugar de una conjetura.
Los benchmarks no sirven para que los números luzcan bien. Sirven para una comparación honesta. Cuando uno se satura, el campo construye uno más difícil. vCX-Hard es como elegimos modelos internamente, y como ahora respondemos a la pregunta que los clientes realmente hacen, con evidencia en lugar de un nombre de marca. Seguiremos subiendo el listón a medida que lo hagan los modelos.
Descubre cuánto podría ahorrar tu empresa al pasar a agentes de voz impulsados por IA.
Total Human Agent Cost
AI Agent Cost
Estimated Savings
Un número de teléfono de demostración de Retell Clinic Office

Start building smarter conversations today.




.avif)