Come costruire un buon agente vocale

Come costruire un buon agente vocale
BACK TO BLOGS
ON THIS PAGE
Back to top

Con l'avanzamento dell'IA generativa, abbiamo assistito a una crescita significativa dei prodotti chatbot che dominano il mercato. Allo stesso tempo, l'IA vocale Γ¨ migliorata al punto che ora sono possibili conversazioni fluide con l'IA. Che tu stia costruendo un'IA per chiamate in entrata e in uscita, servizi professionali, app companion, ecc., la voce rimane una parte centrale dell'esperienza ed Γ¨ importante per la conversione. Possiamo tutti ricordare esperienze frustranti con l'IA durante le chiamate β€” voci robotiche, silenzi imbarazzanti, lunghi periodi di latenza e la necessitΓ  di premere pulsanti per interagire, che nel complesso riducono la qualitΓ  simile a quella umana dell'esperienza e a volte irritano gli utenti.

‍

‍

Qual Γ¨ la differenza tra l'IA vocale e l'essere umano?

‍

Prima di passare direttamente a come costruire una grande esperienza vocale, prendiamoci un momento per ricapitolare come un essere umano interagisce di solito in una conversazione. Operiamo con una latenza di <200ms quando avviene l'alternanza dei turni, forniamo segnali di ascolto quando necessario, capiamo inconsciamente quando l'altra parte finisce il suo turno, comprendiamo il significato e le emozioni dell'altra parte, abbiamo parole di riempimento all'interno delle nostre frasi, smettiamo di parlare quando veniamo interrotti... L'elenco potrebbe continuare, ma il punto essenziale che voglio sottolineare è che ci sono così tanti piccoli meccanismi che avvengono dietro le quinte quando stiamo avendo una conversazione semplice e fluida, ed è estremamente DIFFICILE per le macchine considerare tutto questo e comportarsi come gli esseri umani.

‍

PerchΓ© costruire una buona IA vocale conversazionale Γ¨ difficile?

‍

Una domanda comune che ci viene fatta spesso Γ¨ perchΓ© devo usare l'API di Retell --Non posso semplicemente combinare ASR (speech-to-text), LLM, TTS (text-to-speech) insieme per costruire una conversazione vocale?

‍

Beh, hmm, dovresti assolutamente farlo se hai il tempo, e vedere fino a che punto ti puΓ² portare un semplice approccio di combinazione. Il problema numero uno che sentiamo da chi crea il proprio sistema vocale Γ¨ che Γ¨ difficile ridurre la latenza; il problema numero due che vediamo Γ¨ che la gestione delle interruzioni Γ¨ difficile da implementare con una configurazione semplice; il problema numero tre che vediamo Γ¨ che la risposta dell'agente non Γ¨ abbastanza conversazionale da sembrare umana. Per affrontare tutto questo, esaminiamo una panoramica di quali componenti devono essere presenti e del lavoro che deve essere svolto per una buona esperienza di IA vocale conversazionale.

‍

1. Integra con il frontend web o con strumenti di comunicazione programmabili come Twilio, Vonage per ottenere l'audio dell'utente.

‍

2. Lavora con i byte audio e i protocolli di streaming: L'audio dell'utente proveniente da vari frontend (web, chiamata telefonica) arriverΓ  con codifiche e formati diversi e verrΓ  inviato tramite protocolli di streaming diversi. Questo Γ¨ un compito impegnativo, poichΓ© i byte audio sono difficili da manipolare e richiedono molto tempo per essere gestiti. Chiedi a qualsiasi ingegnere che conosci che lavora con i segnali audio; ti diranno la stessa cosa.

‍

3. Comprendi l'audio: Ci sono vari segnali dall'audio che sono vitali per una conversazione fluida.

‍‍

  • Testo: di solito generato dall'ASR (riconoscimento vocale asincrono), deve essere in streaming, deve essere il piΓΉ veloce e accurato possibile.
  • Emozione: comprendere lo stato emotivo dell'altra parte Γ¨ vitale affinchΓ© gli esseri umani diano una buona risposta nella conversazione.
  • QualitΓ  del segnale audio: se c'Γ¨ rumore di fondo, se c'Γ¨ eco.
  • Speaker diarization: se piΓΉ persone parlano, identificare l'identitΓ  del parlante e identificare chi sta parlando con te e chi no, ecc.
  • TonalitΓ  e altre caratteristiche specifiche del parlante.
  • Pausa: se l'utente smette di parlare, di solito dedotto dal VAD (Voice Activity Detection).

‍

4. Decidi se parlare: capire se l'altra parte finirΓ  presto il suo turno, o se ha giΓ  finito il suo turno, se sta aspettando una risposta o sta semplicemente facendo una pausa per formulare i suoi pensieri, ecc. Deve combinare testo, emozione, tonalitΓ , pausa e altri input audio per generare questa decisione.

‍

  • La parte complicata Γ¨ che gli utenti possono terminare in qualsiasi punto quando non li conosci bene personalmente, e l'IA deve essere preparata per quelle interruzioni brusche.
  • Gli utenti che continuano a parlare inaspettatamente sono meno problematici, poichΓ© l'IA puΓ² semplicemente continuare ad ascoltare e annullare la decisione di parlare.

‍

5. Generare le risposte: Generare una buona risposta a ciΓ² che l'utente ha detto Γ¨ difficile e molto specifico dello scenario. Ci sono vari modi per fare questa parte ed Γ¨ personalizzato per ogni caso d'uso, quindi qui condividerΓ² solo un semplice flusso di generazione delle risposte.

‍

  • RAG (retrieval augmented generation): Incorpora documenti, dati, knowledge base, ecc., in un database vettoriale e recupera solo le informazioni pertinenti da esso. Queste informazioni pertinenti faranno parte del prompt che viene fornito all'LLM.
  • LLM: Questo puΓ² essere un modello self-hosted ottimizzato, o chiamate API a fornitori. Basandosi sulle informazioni pertinenti dell'ultimo passaggio e su alcuni altri prompt personalizzati per l'utente, genera una risposta e trasmette la risposta in streaming a un sistema di generazione vocale.
  • Verifica: per determinate frasi/parole ad alto rischio, magari verifica prima di trasmettere in streaming.

‍

6. Sintetizza l'audio: Di solito ottenuto usando modelli TTS (text to speech), trasforma il testo della risposta in audio. Deve avere una variazione di tono ed emozione che si adatti allo scenario per essere simile a quello umano. Idealmente, l'output TTS dovrebbe essere trasmesso in streaming per una latenza inferiore.

‍

7. Intraprendere azioni: Un'IA che puΓ² parlare Γ¨ fantastica, e un'IA che puΓ² intraprendere azioni Γ¨ ancora piΓΉ fantastica. Questo di solito si ottiene con le funzionalitΓ  di function calling di determinati modelli, o con l'output di dati strutturati, in modo che a valle si possano fissare appuntamenti quando necessario, e cercare informazioni quando appropriato.

‍

  • Quando intraprendi azioni, assicurati che il tuo agente possa comunque rispondere.
  • Un caso d'uso specifico di questo Γ¨ trasferire la chiamata o terminare la chiamata.

‍

‍

Cosa puΓ² fare Retell AI per una buona IA vocale conversazionale?

‍

Penso che a questo punto la maggior parte delle persone sarebbe d'accordo sul fatto che non è così semplice come combinare ASR, LLM, TTS. Quindi, lasciami (spudoratamente) presentare come Retell AI può aiutare qui. Integrando con Retell AI, puoi risparmiare mesi di sviluppo, goderti un'esperienza vocale all'avanguardia e avere tutto quanto segue coperto:

‍

  • Bassa latenza: Applichiamo ottimizzazioni in ogni passaggio, cosΓ¬ la latenza viene ridotta al minimo per la parte audio. Nota che la parte di generazione delle risposte Γ¨ ancora nelle tue mani, quindi abbiamo poco controllo su di essa. La nostra demo Γ¨ di ~800ms tra quando l'utente si ferma e l'agente risponde.
  • Gestione delle interruzioni: L'utente puΓ² interrompere in qualsiasi momento, e l'agente reagisce a ciΓ² con estrema rapiditΓ  come un vero essere umano.
  • Integrazione audio: Possiamo connetterci direttamente con Twilio, e abbiamo reso open source il codice del frontend web.
  • Lavorare con i byte audio: ce ne occupiamo noi e possiamo farti risparmiare centinaia di ore.
  • Comprensione dell'audio: estraiamo informazioni dall'audio con la latenza piΓΉ bassa e ti inviamo trascrizioni in tempo reale (altri segnali in arrivo presto).
  • Decisione su quando parlare: abbiamo il nostro modello di alternanza dei turni e continueremo a iterarlo per prendere decisioni migliori su quando parlare.
  • Sintesi audio: ci integriamo con vari fornitori TTS e abbiamo assunto doppiatori per creare voci simili a quelle umane adatte alla conversazione.
  • Demo e dashboard rapidi: abbiamo configurato la nostra dashboard per supportare la creazione di una demo in 2 minuti.
  • Competenza di settore e supporto: abbiamo competenza di settore in audio, modellazione, creazione di agenti. Siamo qui per aiutarti ogni volta che incontri problemi.

‍

Cosa devi fare tu: continuare a iterare sul tuo prodotto principale per renderlo migliore, mentre noi ci occupiamo della parte audio. Ecco le parti su cui devi lavorare:

‍

  • Generazione delle risposte: anche se supportiamo la creazione di demo sulla dashboard, ci rendiamo conto che per ogni scenario il processo di generazione delle risposte puΓ² essere drasticamente diverso. Pertanto, la nostra API integrerΓ  facilmente la tua soluzione di generazione di risposte personalizzata, indipendentemente dal fatto che si tratti di una semplice chiamata OpenAI o di una configurazione di agente complicata.
  • Intraprendere azioni: affinchΓ© l'agente vocale con IA intraprenda azioni, probabilmente devi integrare con diversi strumenti (calendari, CRM, ecc.). Sta a te decidere quando intraprendere un'azione e quale intraprendere. Non dimenticare di continuare a generare risposte mentre intraprendi azioni.
  • Logica specifica delle chiamate: casi d'uso diversi trasferiranno / termineranno le chiamate in modo diverso, e sta a te decidere i dettagli sul flusso delle chiamate. Questo puΓ² essere configurato tramite function calling.

‍

Spero che questo blog possa darti un'idea di alto livello su come costruire un ottimo agente vocale e, si spera (e spudoratamente), il mio pitch per Retell AI possa far luce su come possiamo aiutare.

‍

Buona costruzione!

ROI Calculator
Estimate Your ROI from Automating Calls

See how much your business could save by switching to AI-powered voice agents.

All done!Β 
Your submission has been sent to your email
Oops! Something went wrong while submitting the form.
Β Β Β 1
Β Β Β 8
20
Oops! Something went wrong while submitting the form.

ROI Result

2,000

Total Human Agent Cost

$5,000
/month

AI Agent Cost

$3,000
/month

Estimated Savings

$2,000
/month
Demo dal vivo
Prova la nostra demo dal vivo

Un numero di telefono demo di Retell Clinic Office

Grazie! Il tuo modulo Γ¨ stato ricevuto!
Ops! Qualcosa Γ¨ andato storto durante l'invio del modulo.

Read Other Blogs

Revolutionize your call operation with Retell