Så bygger du en bra röstagent



Med utvecklingen av generativ AI har vi sett en betydande tillväxt av chatbot-produkter som dominerar marknaden. Samtidigt har röst-AI förbättrats till den grad att smidiga konversationer med AI nu är möjliga. Oavsett om du bygger AI för inkommande och utgående samtal, professionella tjänster, sällskapsappar osv., förblir rösten en central del av upplevelsen och är viktig för konvertering. Vi kan alla minnas frustrerande upplevelser med AI under samtal — robotaktiga röster, obekväma tystnader, långa latensperioder och behovet av att trycka på knappar för att interagera, som tillsammans försämrar den människolika kvaliteten på upplevelsen och ibland irriterar användarna.
Innan vi hoppar rakt in i hur man bygger en bra röstupplevelse, låt oss ta en stund för att sammanfatta hur en människa vanligtvis interagerar i en konversation. Vi arbetar med <200 ms latens när turtagning sker, vi återkopplar vid behov, vi förstår undermedvetet när den andra parten avslutar sin tur, vi förstår den andra partens innebörd och känslor, vi har utfyllnadsord i våra meningar, vi slutar prata när vi blir avbrutna... Listan kan bli längre, men den väsentliga poängen jag gör här är att det pågår så många små mekanismer bakom kulisserna när vi har en enkel, smidig konversation, och det är extremt SVÅRT för maskiner att beakta allt detta och prestera som människor.

En vanlig fråga vi får ofta är varför jag måste använda Retell API --Kan jag inte bara sätta ihop ASR (tal-till-text), LLM, TTS (text-till-tal) för att bygga en röstkonversation?
Tja, hm, det borde du absolut om du har tiden, och se hur långt en enkel ihopsättningsmetod kan ta dig. Det främsta problemet vi hör från dem som gör sitt eget röstsystem är att det är svårt att skära ner latensen; det näst största problemet vi ser är att hantering av avbrott är svårt att implementera med en enkel uppsättning; det tredje problemet vi ser är att agentens svar inte är tillräckligt konversationellt för att låta som en människa. För att ta itu med allt detta, låt oss gå igenom en översikt över vilka komponenter som behöver finnas och det arbete som behöver göras för en bra konversations-röst-AI-upplevelse.
1. Integrera med webbfrontend eller programmerbara kommunikationsverktyg som Twilio, Vonage för att få användarljud.
2. Arbeta med ljudbytes och streamingprotokoll: Användarljud från olika frontends (webb, telefonsamtal) kommer i olika kodningar, format och skickas via olika streamingprotokoll. Detta är en krävande uppgift, eftersom ljudbytes är svåra att manipulera och tidskrävande att arbeta med. Fråga vilken ingenjör du än känner som arbetar med ljudsignaler; de kommer att dela samma uppfattning.
3. Förstå ljudet: Det finns olika signaler från ljud som är avgörande för en smidig konversation.
4. Avgör om det ska tala: förstå huruvida den andra parten snart kommer att avsluta sin tur, eller om de redan har avslutat sin tur, huruvida de väntar på ett svar eller bara pausar för att formulera sina tankar osv. Behöver kombinera text, känsla, tonalitet, paus och annat ljudinput för att generera detta beslut.
5. Generera svaren: Att generera ett bra svar på vad användaren har sagt är svårt och mycket scenariospecifikt. Det finns olika sätt att göra denna del och den anpassas för varje användningsfall, så här delar jag bara ett enkelt flöde för svarsgenerering.
6. Syntetisera ljudet: Uppnås vanligtvis med hjälp av TTS-modeller (text-till-tal), omvandla svarstexten till ljud. Behöver ha ton- och känslovariation som passar scenariot för att vara människolik. Idealiskt bör TTS-outputen streamas tillbaka för lägre latens.
7. Vidta åtgärder: AI som kan tala är coolt, och AI som kan vidta åtgärder är ännu coolare. Detta uppnås vanligtvis med function calling-funktionaliteter i vissa modeller, eller strukturerad datautmatning, så att nedströms kan boka möten vid behov, kan slå upp information när det är lämpligt.
Jag tror att de flesta vid det här laget skulle hålla med om att detta inte är så enkelt som att sätta ihop ASR, LLM, TTS. Låt mig därför (skamlöst) presentera hur Retell AI kan hjälpa till här. Genom att integrera med Retell AI kan du spara månader av utveckling, njuta av en toppmodern röstupplevelse och få allt följande täckt:
Vad du behöver göra: fortsätt iterera på din kärnprodukt för att göra den bättre, medan vi tar hand om ljuddelen. Här är de delar du behöver arbeta med:
Jag hoppas att den här bloggen kan ge dig en övergripande idé om hur man bygger en bra röstagent, och förhoppningsvis (och skamlöst) kan min pitch för Retell AI belysa hur vi kan hjälpa till.
Lycka till med byggandet!
See how much your business could save by switching to AI-powered voice agents.
Total Human Agent Cost
AI Agent Cost
Estimated Savings
Ett demonummer från Retell Clinic Office

Start building smarter conversations today.


.avif)
.avif)