Pruebas de carga de agentes de voz: cómo probar tus propios agentes de voz a escala con Retell

Pruebas de carga de agentes de voz: cómo probar tus propios agentes de voz a escala con Retell

Las pruebas de carga de agentes de voz son la forma de averiguar si tu agente de voz con IA sigue funcionando cuando 200 personas llaman a la vez, no solo cuando ejecutas una llamada limpia en una demo.

Es la diferencia entre un agente que luce genial en el escenario y uno que aguanta el día del lanzamiento.

Aquí está lo que muchos creadores de IA de voz pasan por alto. Puedes ejecutar este tipo de pruebas a escala en la propia Retell, usando la misma plataforma con la que lanzarías el agente.

Esta guía está escrita para ingenieros de IA y equipos de plataforma. Cubre qué son las pruebas de carga de agentes de voz, por qué probar a escala rompe la QA normal y cómo configurar grandes rondas de pruebas en Retell.

TL;DR

  • Las pruebas de carga de agentes de voz comprueban cómo se comporta tu agente ante muchas llamadas simultáneas, no una llamada cada vez.

  • Probar a escala saca a la luz fallos que una sola llamada nunca muestra: límites de tasa, picos de latencia, pérdida de contexto y respuestas que se degradan bajo carga.

  • El caso de uso oculto: Retell puede ejecutar estas pruebas por ti, usando llamadas por lotes, QA integrada y análisis posterior a la llamada.

  • Prueba cuatro cosas a escala: cobertura funcional, carga y concurrencia, regresión en cada cambio y entradas adversarias.

  • Mide percentiles de latencia (P50, P90, P99), tasa de error de palabras, finalización de tareas y contención, no promedios.

  • Puedes empezar en Retell, traer tu propia telefonía y prever el coste a partir de una tarifa por minuto publicada.

Qué son las pruebas de carga de agentes de voz

Las pruebas de carga de agentes de voz son una forma de pruebas de carga pensada para agentes de voz con IA. Simulas a muchas personas hablando con tu agente al mismo tiempo y luego mides si se mantiene rápido, preciso y coherente a medida que sube la carga.

Se enmarca en la práctica más amplia de las pruebas de rendimiento de software, que comprueban cómo se comporta un sistema ante una carga de trabajo determinada. El matiz con los agentes de voz es que la carga de trabajo no es solo tráfico. Es cómputo.

Un sistema telefónico tradicional tiene una carga predecible. Contestar la línea, reproducir un menú, enrutar la llamada. Un agente de voz con IA ejecuta speech-to-text, un modelo de lenguaje y text-to-speech en cada turno, así que cada llamada simultánea consume tokens y tiempo de GPU, no solo una línea telefónica.

Por eso probar a escala es un problema diferente. Diez llamadas pueden ir bien. Con doscientas, tu proveedor de modelos empieza a devolver errores de límite de tasa, la latencia sube y el agente que sonaba nítido ahora hace pausas incómodas o corta a quien llama.

Por qué probar agentes de voz a escala rompe la QA normal

Buena parte de la QA de agentes de voz comprueba una llamada cada vez. Eso detecta errores de redacción y de lógica, pero oculta los fallos que solo aparecen bajo presión. Algunos que golpean a los equipos en el lanzamiento:

  • Límites de tasa y errores de cuota: bajo carga, tu modelo de lenguaje o proveedor de voz puede limitar las peticiones, así que algunas llamadas se atascan o fallan a mitad de la conversación.

  • Latencia bajo carga: una respuesta que se devuelve en 300 ms en una prueba en solitario puede alargarse más de un segundo cuando el stack está ocupado, lo que rompe el ritmo de una llamada.

  • Contexto perdido o degradado: a medida que sube la concurrencia, algunos sistemas recortan el historial de la conversación para ahorrar cómputo, así que el agente olvida lo que dijo quien llama hace dos turnos.

  • Calidad que baja en silencio: un agente que es paciente con carga baja puede volverse seco y propenso a errores cuando los servidores están al máximo. Prueba una sola llamada y nunca lo verás.

  • Límites de telefonía: los topes de concurrencia de tu operador o plataforma pueden bloquear llamadas antes de que la IA sea siquiera el cuello de botella.

Ninguno de estos aparece en una única llamada de camino feliz. Todos aparecen cuando llega el tráfico de producción. Las pruebas de carga son la forma de encontrártelos en tu calendario en vez de en el de tus clientes.

Qué probar cuando ejecutas agentes de voz a escala

Probar a escala no va solo de volumen. Dirige tus rondas a cuatro cosas:

  • Cobertura funcional: ejecuta tus tipos de llamada principales y los casos límite incómodos, como interrupciones, acentos, ruido de fondo y preguntas fuera de guion, a lo largo de muchas llamadas en vez de cinco.

  • Carga y concurrencia: escala desde una línea base hasta tu pico esperado y más allá, observando dónde se rompen la latencia y las tasas de error.

  • Regresión: vuelve a ejecutar toda la suite en cada cambio de prompt, modelo o voz para que un arreglo en un sitio no rompa otro. Esto es pruebas de regresión estándar, aplicadas a la voz.

  • Adversarias y de seguridad: sondea en busca de jailbreaks, fugas de prompt y respuestas fuera de política antes de que lo haga otra persona.

Un patrón útil de las pruebas de rendimiento: fija una línea base con concurrencia baja, escala por pasos, vigila el punto de ruptura y luego confirma que el sistema se recupera después de que baje la carga.

El caso de uso oculto: usar Retell para probar tus propios agentes de voz

Aquí viene la revelación. Retell AI es conocida como una plataforma para crear y lanzar agentes de voz con IA, pero la misma plataforma ejecuta las pruebas.

Puedes impulsar grandes rondas de pruebas con llamadas por lotes, que realizan muchas llamadas de una lista a la vez. Apúntalas a tus números y perfiles de prueba y tendrás una forma de generar carga simultánea bajo demanda.

Cada una de esas llamadas se puede puntuar con garantía de calidad con IA integrada, así que no tienes que escuchar cientos de grabaciones a mano para encontrar los fallos.

El análisis posterior a la llamada registra cada llamada, de prueba o real, para que puedas leer transcripciones, revisar resultados y ver dónde se rompió un flujo en toda la ronda.

Como Retell se conecta a tu propia telefonía a través de Twilio y Vonage, tú controlas el lado del operador de la prueba en vez de pagar un traspaso con recargo.

Para ingenieros, la documentación para desarrolladores cubre las API para automatizar todo esto en tu propia pipeline.

Las llamadas de prueba pasan por todo el stack, así que se facturan como llamadas. Los precios son por minuto y están publicados, así que puedes prever un presupuesto de pruebas de carga antes de ejecutarlas.

Cómo configurar pruebas de carga de agentes de voz con Retell

Una configuración que funciona tiene este aspecto:

  1. Define tus escenarios y perfiles. Empieza por tus tipos de llamada principales y luego añade los casos límite que te preocupan: interrupciones, acentos y peticiones fuera de guion.

  2. Crea el agente, o una copia de prueba, en Retell, conectado a una base de conocimiento y a cualquier herramienta que use en producción.

  3. Conecta tu propia telefonía para que el tráfico de prueba pase por la ruta de operador que vas a usar de verdad.

  4. Usa las llamadas por lotes para lanzar muchas llamadas a la vez, escalando la concurrencia desde una línea base hasta superar tu pico esperado.

  5. Puntúa los resultados con QA de IA y luego revísalos en el análisis posterior a la llamada, filtrando por llamadas fallidas o de baja calidad.

  6. Corrige y vuelve a ejecutar la suite. Bloquea la publicación en función de los resultados para que nada se lance hasta que los números aguanten.

Conecta los pasos cuatro a seis a tu pipeline de CI y las pruebas de carga dejan de ser una carrera de la semana del lanzamiento para convertirse en algo que se ejecuta en cada cambio.

Métricas que importan bajo carga

Los promedios ocultan las llamadas que arruinan la confianza. Mide distribuciones en su lugar:

  • Percentiles de latencia (P50, P90, P99): el P99 es la persona que se queda esperando mientras a todas las demás les va bien. Apunta a mantener tu objetivo incluso a dos o tres veces el pico esperado.

  • Tasa de error de palabras: con qué frecuencia el speech-to-text malinterpreta a quien llama, algo que sube con los acentos, el ruido y la carga.

  • Tasa de finalización de tareas: ¿resolvió el agente aquello por lo que llamaba la persona?

  • Tasa de contención: cuántas llamadas gestionó el agente sin una transferencia a una persona.

  • Tasa de error y de caída: llamadas que fallaron, se atascaron o perdieron el audio bajo concurrencia.

Fija umbrales por escenario, ya que un agente bancario y una línea de pedidos de comida toleran tasas de error distintas. Los números varían con tu stack, modelo y tráfico, así que trátalos como tus propias líneas base, no como objetivos universales.

Buenas prácticas para probar a escala

  • Prueba con voces que coincidan con quienes te llaman. Cubre los acentos e idiomas de tus propios registros de llamadas y añade el ruido de un coche o de una oficina con mucho movimiento.

  • Escala de forma gradual. Primero la línea base, luego sube la concurrencia por pasos para ver dónde se dobla el rendimiento antes de romperse.

  • Reproduce los fallos de producción. Cuando una llamada real sale mal, captúrala y añádela a la suite para que nunca pueda volver a fallar en silencio.

  • Mide la calidad, no solo la finalización de la llamada. Una línea abierta no es un éxito si la IA se ha vuelto tonta bajo carga.

  • Automatiza la suite. La QA manual cubre un puñado de llamadas; la automatización cubre cientos en cada cambio.

  • Mantén a personas en el proceso para las llamadas más matizadas. La puntuación automatizada más una revisión humana puntual detecta lo que cada una por separado se pierde.

Preguntas frecuentes

¿Qué son las pruebas de carga de agentes de voz?

Son pruebas de rendimiento para agentes de voz con IA. Simulas muchas llamadas simultáneas y luego mides si el agente se mantiene rápido, preciso y coherente a medida que sube la carga. Se dirigen a fallos como límites de tasa y picos de latencia que las pruebas de una sola llamada nunca sacan a la luz.

¿Puedo usar Retell para probar agentes de voz a escala?

Sí. Puedes crear o copiar un agente en Retell, usar las llamadas por lotes para realizar muchas llamadas a la vez, puntuarlas con QA integrada y revisar los resultados en el análisis posterior a la llamada. Eso te da carga simultánea y evaluación automatizada en una sola plataforma.

¿En qué se diferencian las pruebas de carga de las pruebas normales de agentes de voz?

Las pruebas normales comprueban una llamada en busca de redacción y lógica correctas. Las pruebas de carga comprueban muchas llamadas a la vez para ver el comportamiento bajo presión: latencia con concurrencia, limitación de tasa, pérdida de contexto y calidad que baja cuando los servidores están ocupados.

¿Cuántas llamadas simultáneas debería probar?

Empieza en una línea base de 10 a 50, luego sube hasta tu pico esperado y más allá, observando dónde se rompen la latencia y los errores. El objetivo es encontrar tu punto de ruptura a propósito, antes de que lo haga el tráfico real.

¿Las pruebas de carga cuestan más en una plataforma de pago por minuto?

Las llamadas de prueba pasan por el mismo stack que las llamadas reales, así que se facturan por minuto. Elige una plataforma con una tarifa publicada y que te permita traer tu propia telefonía para que puedas prever el coste y mantener la línea del operador bajo control.

Comprueba cómo aguanta tu agente antes de que lo hagan quienes te llaman.

Retell te permite crear, probar y monitorizar agentes de voz con IA en una sola plataforma, con llamadas por lotes, QA integrada y precios por minuto publicados. Prueba Retell gratis o habla con ventas.

Calculadora de ROI
Estima tu ROI al automatizar las llamadas

Descubre cuánto podría ahorrar tu empresa al pasar a agentes de voz impulsados por IA.

¡Listo! 
Tu envío se ha mandado a tu correo electrónico
¡Vaya! Algo salió mal al enviar el formulario.
   1
   8
20
¡Vaya! Algo salió mal al enviar el formulario.

Resultado del ROI

2,000

Total Human Agent Cost

$5,000
/month

AI Agent Cost

$3,000
/month

Estimated Savings

$2,000
/month
Demo en Directo
Prueba Nuestra Demo en Directo

Un número de teléfono de demostración de Retell Clinic Office

¡Gracias! ¡Tu envío ha sido recibido!
¡Vaya! Algo salió mal al enviar el formulario.

Read Other Blogs

No items found.

Revolutionize your call operation with Retell