Så bygger du en bra röstagent

Så bygger du en bra röstagent
BACK TO BLOGS
ON THIS PAGE
Back to top

Med utvecklingen av generativ AI har vi sett en betydande tillväxt av chatbot-produkter som dominerar marknaden. Samtidigt har röst-AI förbättrats till den grad att smidiga konversationer med AI nu är möjliga. Oavsett om du bygger AI för inkommande och utgående samtal, professionella tjänster, sällskapsappar osv., förblir rösten en central del av upplevelsen och är viktig för konvertering. Vi kan alla minnas frustrerande upplevelser med AI under samtal — robotaktiga röster, obekväma tystnader, långa latensperioder och behovet av att trycka på knappar för att interagera, som tillsammans försämrar den människolika kvaliteten på upplevelsen och ibland irriterar användarna.

Vad är skillnaden mellan röst-AI och människa?

Innan vi hoppar rakt in i hur man bygger en bra röstupplevelse, låt oss ta en stund för att sammanfatta hur en människa vanligtvis interagerar i en konversation. Vi arbetar med <200 ms latens när turtagning sker, vi återkopplar vid behov, vi förstår undermedvetet när den andra parten avslutar sin tur, vi förstår den andra partens innebörd och känslor, vi har utfyllnadsord i våra meningar, vi slutar prata när vi blir avbrutna... Listan kan bli längre, men den väsentliga poängen jag gör här är att det pågår så många små mekanismer bakom kulisserna när vi har en enkel, smidig konversation, och det är extremt SVÅRT för maskiner att beakta allt detta och prestera som människor.

Varför är det svårt att bygga en bra konversations-röst-AI?

En vanlig fråga vi får ofta är varför jag måste använda Retell API --Kan jag inte bara sätta ihop ASR (tal-till-text), LLM, TTS (text-till-tal) för att bygga en röstkonversation?

Tja, hm, det borde du absolut om du har tiden, och se hur långt en enkel ihopsättningsmetod kan ta dig. Det främsta problemet vi hör från dem som gör sitt eget röstsystem är att det är svårt att skära ner latensen; det näst största problemet vi ser är att hantering av avbrott är svårt att implementera med en enkel uppsättning; det tredje problemet vi ser är att agentens svar inte är tillräckligt konversationellt för att låta som en människa. För att ta itu med allt detta, låt oss gå igenom en översikt över vilka komponenter som behöver finnas och det arbete som behöver göras för en bra konversations-röst-AI-upplevelse.

1. Integrera med webbfrontend eller programmerbara kommunikationsverktyg som Twilio, Vonage för att få användarljud.

2. Arbeta med ljudbytes och streamingprotokoll: Användarljud från olika frontends (webb, telefonsamtal) kommer i olika kodningar, format och skickas via olika streamingprotokoll. Detta är en krävande uppgift, eftersom ljudbytes är svåra att manipulera och tidskrävande att arbeta med. Fråga vilken ingenjör du än känner som arbetar med ljudsignaler; de kommer att dela samma uppfattning.

3. Förstå ljudet: Det finns olika signaler från ljud som är avgörande för en smidig konversation.

  • Text: genereras vanligtvis från ASR (asynkron taligenkänning), behöver vara streamande, behöver vara så snabb och exakt som möjligt.
  • Känsla: att förstå den andra partens känslotillstånd är avgörande för att människor ska kunna ge ett bra svar i en konversation.
  • Ljudsignalkvalitet: om det finns bakgrundsljud, om det finns eko.
  • Speaker diarization: om flera personer talar, identifiera talaridentitet och identifiera vem som talar till dig och vem som inte gör det osv.
  • Tonalitet och andra talarspecifika egenskaper.
  • Paus: huruvida användaren slutar prata, vanligtvis härlett från VAD (Voice Activity Detection).

4. Avgör om det ska tala: förstå huruvida den andra parten snart kommer att avsluta sin tur, eller om de redan har avslutat sin tur, huruvida de väntar på ett svar eller bara pausar för att formulera sina tankar osv. Behöver kombinera text, känsla, tonalitet, paus och annat ljudinput för att generera detta beslut.

  • Det kluriga är att användare kan sluta var som helst när du inte känner dem väl personligen, och AI måste vara förberedd på dessa abrupta slut.
  • Att användare oväntat fortsätter att tala är mindre av ett problem, eftersom AI bara kan fortsätta att lyssna och ändra beslutet att tala.

5. Generera svaren: Att generera ett bra svar på vad användaren har sagt är svårt och mycket scenariospecifikt. Det finns olika sätt att göra denna del och den anpassas för varje användningsfall, så här delar jag bara ett enkelt flöde för svarsgenerering.

  • RAG (retrieval augmented generation): Bäddar in dokument, data, kunskapsbas osv. i en vektordatabas och hämtar endast den relevanta informationen från den. Denna relevanta info kommer att vara en del av prompten som matas in i LLM.
  • LLM: Detta kan vara en finjusterad självhostad modell, eller API-anrop till leverantörer. Baserat på den relevanta informationen från det senaste steget och några andra prompter som är anpassade för användaren, generera ett svar och streama tillbaka svaret till ett röstgenereringssystem.
  • Verifiering: för vissa fraser/ord med hög risk, verifiera kanske innan du streamar tillbaka.

6. Syntetisera ljudet: Uppnås vanligtvis med hjälp av TTS-modeller (text-till-tal), omvandla svarstexten till ljud. Behöver ha ton- och känslovariation som passar scenariot för att vara människolik. Idealiskt bör TTS-outputen streamas tillbaka för lägre latens.

7. Vidta åtgärder: AI som kan tala är coolt, och AI som kan vidta åtgärder är ännu coolare. Detta uppnås vanligtvis med function calling-funktionaliteter i vissa modeller, eller strukturerad datautmatning, så att nedströms kan boka möten vid behov, kan slå upp information när det är lämpligt.

  • När du vidtar åtgärder, se till att din agent fortfarande kan svara.
  • Ett specifikt användningsfall av detta är att överföra samtalet eller avsluta samtalet.

Vad kan Retell AI göra för en bra konversations-röst-AI?

Jag tror att de flesta vid det här laget skulle hålla med om att detta inte är så enkelt som att sätta ihop ASR, LLM, TTS. Låt mig därför (skamlöst) presentera hur Retell AI kan hjälpa till här. Genom att integrera med Retell AI kan du spara månader av utveckling, njuta av en toppmodern röstupplevelse och få allt följande täckt:

  • Låg latens: Vi tillämpar optimeringar i varje steg, så latensen reduceras till det lägsta för ljuddelen. Observera att svarsgenereringsdelen fortfarande ligger i dina händer, så vi har liten kontroll över det. Vår demo är ~800 ms mellan när användaren slutar och agenten svarar.
  • Hantering av avbrott: Användaren kan avbryta när som helst, och agenten reagerar blixtsnabbt på det som en riktig människa.
  • Ljudintegration: Vi kan ansluta direkt med Twilio, och vi har öppen källkod för webbfrontend-kod.
  • Arbeta med ljudbytes: vi har det täckt och kan spara dig hundratals timmar.
  • Ljudförståelse: vi utvinner insikter från ljud med lägsta latens och skickar realtidstranskript (andra signaler kommer snart) till dig.
  • Beslut om när det ska tala: vi har vår egen turtagningsmodell och kommer att fortsätta iterera på den för att fatta bättre beslut om när det ska tala.
  • Ljudsyntes: vi integrerar med olika TTS-leverantörer och anlitade röstskådespelare för att skapa människolika röster som passar för konversation.
  • Snabb demo & dashboard: vi har satt upp vår dashboard för att stödja byggandet av en demo inom 2 minuter.
  • Domänexpertis & support: vi har domänexpertis inom ljud, modellering, agentskapande. Vi finns här för att hjälpa till närhelst du stöter på problem.

Vad du behöver göra: fortsätt iterera på din kärnprodukt för att göra den bättre, medan vi tar hand om ljuddelen. Här är de delar du behöver arbeta med:

  • Svarsgenerering: även om vi stöder demoskapande på dashboarden, inser vi att svarsgenereringsprocessen kan vara drastiskt annorlunda för varje scenario. Därför integrerar vårt API enkelt din anpassade svarsgenereringslösning, oavsett om det är ett enkelt OpenAI-anrop eller en komplicerad agentuppsättning.
  • Vidta åtgärder: för att röstagenten ska vidta åtgärder måste du förmodligen integrera med olika verktyg (kalendrar, CRM osv.). Det är upp till dig att avgöra när du ska vidta åtgärder och vad du ska vidta. Glöm inte att fortsätta generera svar medan du vidtar åtgärder.
  • Specifik samtalslogik: olika användningsfall kommer att överföra / avsluta samtal på olika sätt, och det är upp till dig att avgöra detaljer om call flow. Detta kan sättas upp via function calling.

Jag hoppas att den här bloggen kan ge dig en övergripande idé om hur man bygger en bra röstagent, och förhoppningsvis (och skamlöst) kan min pitch för Retell AI belysa hur vi kan hjälpa till.

Lycka till med byggandet!

ROI Calculator
Estimate Your ROI from Automating Calls

See how much your business could save by switching to AI-powered voice agents.

All done! 
Your submission has been sent to your email
Oops! Something went wrong while submitting the form.
   1
   8
20
Oops! Something went wrong while submitting the form.

ROI Result

2,000

Total Human Agent Cost

$5,000
/month

AI Agent Cost

$3,000
/month

Estimated Savings

$2,000
/month
Live Demo
Prova vår live-demo

Ett demonummer från Retell Clinic Office

Tack! Din inskickning har mottagits!
Hoppsan! Något gick fel när formuläret skickades.

Read Other Blogs

Revolutionize your call operation with Retell