Come costruire un buon agente vocale



Con l'avanzamento dell'IA generativa, abbiamo assistito a una crescita significativa dei prodotti chatbot che dominano il mercato. Allo stesso tempo, l'IA vocale Γ¨ migliorata al punto che ora sono possibili conversazioni fluide con l'IA. Che tu stia costruendo un'IA per chiamate in entrata e in uscita, servizi professionali, app companion, ecc., la voce rimane una parte centrale dell'esperienza ed Γ¨ importante per la conversione. Possiamo tutti ricordare esperienze frustranti con l'IA durante le chiamate β voci robotiche, silenzi imbarazzanti, lunghi periodi di latenza e la necessitΓ di premere pulsanti per interagire, che nel complesso riducono la qualitΓ simile a quella umana dell'esperienza e a volte irritano gli utenti.
β
β
β
Prima di passare direttamente a come costruire una grande esperienza vocale, prendiamoci un momento per ricapitolare come un essere umano interagisce di solito in una conversazione. Operiamo con una latenza di <200ms quando avviene l'alternanza dei turni, forniamo segnali di ascolto quando necessario, capiamo inconsciamente quando l'altra parte finisce il suo turno, comprendiamo il significato e le emozioni dell'altra parte, abbiamo parole di riempimento all'interno delle nostre frasi, smettiamo di parlare quando veniamo interrotti... L'elenco potrebbe continuare, ma il punto essenziale che voglio sottolineare è che ci sono così tanti piccoli meccanismi che avvengono dietro le quinte quando stiamo avendo una conversazione semplice e fluida, ed è estremamente DIFFICILE per le macchine considerare tutto questo e comportarsi come gli esseri umani.

β
β
Una domanda comune che ci viene fatta spesso Γ¨ perchΓ© devo usare l'API di Retell --Non posso semplicemente combinare ASR (speech-to-text), LLM, TTS (text-to-speech) insieme per costruire una conversazione vocale?
β
Beh, hmm, dovresti assolutamente farlo se hai il tempo, e vedere fino a che punto ti puΓ² portare un semplice approccio di combinazione. Il problema numero uno che sentiamo da chi crea il proprio sistema vocale Γ¨ che Γ¨ difficile ridurre la latenza; il problema numero due che vediamo Γ¨ che la gestione delle interruzioni Γ¨ difficile da implementare con una configurazione semplice; il problema numero tre che vediamo Γ¨ che la risposta dell'agente non Γ¨ abbastanza conversazionale da sembrare umana. Per affrontare tutto questo, esaminiamo una panoramica di quali componenti devono essere presenti e del lavoro che deve essere svolto per una buona esperienza di IA vocale conversazionale.
β
1. Integra con il frontend web o con strumenti di comunicazione programmabili come Twilio, Vonage per ottenere l'audio dell'utente.
β
2. Lavora con i byte audio e i protocolli di streaming: L'audio dell'utente proveniente da vari frontend (web, chiamata telefonica) arriverΓ con codifiche e formati diversi e verrΓ inviato tramite protocolli di streaming diversi. Questo Γ¨ un compito impegnativo, poichΓ© i byte audio sono difficili da manipolare e richiedono molto tempo per essere gestiti. Chiedi a qualsiasi ingegnere che conosci che lavora con i segnali audio; ti diranno la stessa cosa.
β
3. Comprendi l'audio: Ci sono vari segnali dall'audio che sono vitali per una conversazione fluida.
ββ
β
4. Decidi se parlare: capire se l'altra parte finirΓ presto il suo turno, o se ha giΓ finito il suo turno, se sta aspettando una risposta o sta semplicemente facendo una pausa per formulare i suoi pensieri, ecc. Deve combinare testo, emozione, tonalitΓ , pausa e altri input audio per generare questa decisione.
β
β
5. Generare le risposte: Generare una buona risposta a ciΓ² che l'utente ha detto Γ¨ difficile e molto specifico dello scenario. Ci sono vari modi per fare questa parte ed Γ¨ personalizzato per ogni caso d'uso, quindi qui condividerΓ² solo un semplice flusso di generazione delle risposte.
β
β
6. Sintetizza l'audio: Di solito ottenuto usando modelli TTS (text to speech), trasforma il testo della risposta in audio. Deve avere una variazione di tono ed emozione che si adatti allo scenario per essere simile a quello umano. Idealmente, l'output TTS dovrebbe essere trasmesso in streaming per una latenza inferiore.
β
7. Intraprendere azioni: Un'IA che puΓ² parlare Γ¨ fantastica, e un'IA che puΓ² intraprendere azioni Γ¨ ancora piΓΉ fantastica. Questo di solito si ottiene con le funzionalitΓ di function calling di determinati modelli, o con l'output di dati strutturati, in modo che a valle si possano fissare appuntamenti quando necessario, e cercare informazioni quando appropriato.
β
β
β
β
Penso che a questo punto la maggior parte delle persone sarebbe d'accordo sul fatto che non è così semplice come combinare ASR, LLM, TTS. Quindi, lasciami (spudoratamente) presentare come Retell AI può aiutare qui. Integrando con Retell AI, puoi risparmiare mesi di sviluppo, goderti un'esperienza vocale all'avanguardia e avere tutto quanto segue coperto:
β
β
Cosa devi fare tu: continuare a iterare sul tuo prodotto principale per renderlo migliore, mentre noi ci occupiamo della parte audio. Ecco le parti su cui devi lavorare:
β
β
Spero che questo blog possa darti un'idea di alto livello su come costruire un ottimo agente vocale e, si spera (e spudoratamente), il mio pitch per Retell AI possa far luce su come possiamo aiutare.
β
Buona costruzione!
See how much your business could save by switching to AI-powered voice agents.
Total Human Agent Cost
AI Agent Cost
Estimated Savings
Un numero di telefono demo di Retell Clinic Office

Start building smarter conversations today.


.avif)
.avif)