Cómo crear un buen agente de voz



Con el avance de la IA generativa, hemos sido testigos de un crecimiento significativo de los productos de chatbot que dominan el mercado. Al mismo tiempo, la IA de voz ha mejorado hasta el punto de que ahora es posible mantener conversaciones fluidas con la IA. Tanto si estás creando IA para llamadas entrantes y salientes, servicios profesionales, apps de compañía, etc., la voz sigue siendo una parte fundamental de la experiencia y es importante para la conversión. Todos recordamos experiencias frustrantes con la IA durante las llamadas: voces robóticas, silencios incómodos, largos periodos de latencia y la necesidad de pulsar botones para interactuar, que en conjunto reducen la calidad humanizada de la experiencia y en ocasiones irritan a los usuarios.
Antes de entrar de lleno en cómo crear una gran experiencia de voz, tomémonos un momento para repasar cómo interactúa normalmente un humano en una conversación. Operamos con una latencia de <200ms cuando se produce el cambio de turno, damos señales de escucha según sea necesario, entendemos de forma subconsciente cuándo la otra parte termina su turno, comprendemos el significado y las emociones de la otra parte, usamos muletillas dentro de nuestras frases, dejamos de hablar cuando nos interrumpen... La lista podría continuar, pero lo esencial que quiero transmitir aquí es que hay muchísimos pequeños mecanismos que ocurren entre bastidores cuando mantenemos una conversación sencilla y fluida, y es extremadamente DIFÍCIL que las máquinas tengan en cuenta todo esto y actúen como los humanos.

Una pregunta habitual que nos hacen mucho es por qué tengo que usar la API de Retell: ¿no puedo simplemente combinar ASR (speech-to-text), LLM y TTS (text-to-speech) para crear una conversación de voz?
Bueno, mmm, deberías hacerlo si tienes tiempo, y ver hasta dónde te lleva un enfoque de simple combinación. El problema número uno que oímos de quienes crean su propio sistema de voz es que es difícil reducir la latencia; el problema número dos que vemos es que la gestión de interrupciones es difícil de implementar con una configuración sencilla; el problema número tres que vemos es que la respuesta del agente no es lo bastante conversacional como para sonar como un humano. Para abordar todo esto, repasemos una visión general de qué componentes deben estar presentes y qué trabajo hay que hacer para lograr una buena experiencia de IA de voz conversacional.
1. Integra con un frontend web o con herramientas de comunicación programables como Twilio, Vonage para obtener el audio del usuario.
2. Trabaja con bytes de audio y protocolos de streaming: el audio del usuario procedente de distintos frontends (web, llamada telefónica) llegará en diferentes codificaciones, formatos y se enviará a través de distintos protocolos de streaming. Es una tarea ardua, ya que los bytes de audio son difíciles de manipular y llevan mucho tiempo. Pregunta a cualquier ingeniero que conozcas que trabaje con señales de audio; te dirán lo mismo.
3. Comprende el audio: hay varias señales del audio que son vitales para una conversación fluida.
4. Decide si hablar: comprender si la otra parte terminará pronto su turno, o si ya lo ha terminado, si está esperando una respuesta o simplemente hace una pausa para ordenar sus ideas, etc. Es necesario combinar texto, emoción, tonalidad, pausa y otras entradas de audio para generar esta decisión.
5. Generar las respuestas: generar una buena respuesta a lo que el usuario ha dicho es difícil y muy específico de cada escenario. Hay varias formas de hacer esta parte y se personaliza para cada caso de uso, así que aquí solo compartiré un flujo sencillo de generación de respuestas.
6. Sintetiza el audio: normalmente se logra usando modelos TTS (text to speech), transforma el texto de la respuesta en audio. Debe tener variación de tono y emoción que se adapte al escenario para ser humanizado. Idealmente, la salida del TTS debería enviarse en streaming de vuelta para una menor latencia.
7. Realizar acciones: una IA que puede hablar es genial, y una IA que puede realizar acciones es aún más genial. Esto normalmente se logra con las funcionalidades de function calling de ciertos modelos, o con salida de datos estructurada, de modo que la parte posterior pueda concertar citas cuando sea necesario y buscar información cuando corresponda.
Creo que a estas alturas la mayoría estará de acuerdo en que esto no es tan fácil como combinar ASR, LLM y TTS. Así que déjame presentar (sin ningún pudor) cómo Retell AI puede ayudar aquí. Al integrarte con Retell AI, puedes ahorrar meses de desarrollo, disfrutar de una experiencia de voz de vanguardia y tener cubierto todo lo siguiente:
Lo que tú tienes que hacer: seguir iterando en tu producto principal para mejorarlo, mientras nosotros nos encargamos de la parte de audio. Estas son las partes en las que tienes que trabajar:
Espero que este blog pueda darte una idea general de cómo crear un gran agente de voz y, con suerte (y sin ningún pudor), que mi presentación de Retell AI pueda arrojar luz sobre cómo podemos ayudar.
¡Feliz creación!
Descubre cuánto podría ahorrar tu empresa al pasar a agentes de voz impulsados por IA.
Total Human Agent Cost
AI Agent Cost
Estimated Savings
Un número de teléfono de demostración de Retell Clinic Office

Start building smarter conversations today.


.avif)
.avif)