Sådan bygger du en god stemmeagent



Med udviklingen af generativ AI har vi været vidne til betydelig vækst i chatbot-produkter, der dominerer markedet. Samtidig er stemme-AI blevet forbedret i en sådan grad, at glidende samtaler med AI nu er mulige. Uanset om du bygger AI til indgående og udgående opkald, professionelle tjenester, ledsager-apps osv., forbliver stemmen en central del af oplevelsen og er vigtig for konvertering. Vi kan alle huske frustrerende oplevelser med AI under opkald — robotagtige stemmer, akavet stilhed, lange latensperioder og behovet for at trykke på knapper for at interagere, som tilsammen forringer oplevelsens naturlige kvalitet og af og til irriterer brugerne.
Før vi springer direkte ind i, hvordan man bygger en god stemmeoplevelse, så lad os tage et øjeblik til at opsummere, hvordan et menneske normalt interagerer i en samtale. Vi opererer med <200ms latens, når turtagning sker, vi giver tilbagemeldinger efter behov, vi forstår ubevidst, hvornår den anden part er færdig med sin tur, vi forstår den anden parts mening og følelser, vi har fyldord i vores sætninger, vi holder op med at tale, når vi bliver afbrudt... Listen kan fortsætte, men den essentielle pointe, jeg gør her, er, at der sker så mange små mekanismer bag kulisserne, når vi har en enkel, glidende samtale, og det er ekstremt SVÆRT for maskiner at tage højde for alt dette og præstere som mennesker.

Et almindeligt spørgsmål, vi ofte får, er, hvorfor jeg skal bruge Retell API --Kan jeg ikke bare sy ASR (speech-to-text), LLM, TTS (text-to-speech) sammen for at bygge en stemmesamtale?
Nå, hmm, det burde du absolut, hvis du har tiden, og se, hvor langt en simpel sammensyningsmetode kan bringe dig. Det problem nummer et, vi hører fra dem, der laver deres eget stemmesystem, er, at det er svært at skære latens ned; problem nummer to, vi ser, er, at afbrydelseshåndtering er svær at implementere med en simpel opsætning; problem nummer tre, vi ser, er, at agentens svar ikke er samtalende nok til at lyde som et menneske. For at tackle alt dette, lad os gennemgå et overblik over, hvilke komponenter der skal være til stede, og det arbejde, der skal gøres for en god konversationel stemme-AI-oplevelse.
1. Integrer med web-frontend eller programmerbare kommunikationsværktøjer som Twilio, Vonage for at få brugerlyd.
2. Arbejd med audio bytes og streaming-protokoller: Brugerlyd fra forskellige frontends (web, opkald) kommer i forskellige indkodninger, formater og sendes over via forskellige streaming-protokoller. Dette er en anstrengende opgave, da audio bytes er svære at manipulere og tidskrævende at arbejde med. Spørg en hvilken som helst ingeniør, du kender, der arbejder med lydsignaler; de vil dele det samme udsagn.
3. Forstå lyden: Der er forskellige signaler fra lyd, som er afgørende for en glidende samtale.
4. Beslut, om der skal tales: forstå, om den anden part snart afslutter sin tur, eller de allerede har afsluttet deres tur, om de afventer et svar eller bare holder pause for at formulere deres tanker osv. Skal kombinere tekst, følelse, tonalitet, pause og anden lydinput for at generere denne beslutning.
5. Generering af svar: At generere et godt svar på det, brugeren har sagt, er svært og meget scenariespecifikt. Der er forskellige måder at gøre denne del på, og den tilpasses hvert enkelt anvendelsestilfælde, så her vil jeg blot dele ét simpelt flow for svargenerering.
6. Syntetiser lyden: Opnås normalt ved hjælp af TTS-modeller (text to speech), transformer svarteksten til lyd. Skal have tone- og følelsesvariation, der passer til scenariet for at være menneskelignende. Ideelt set bør TTS-outputtet streames tilbage for lavere latens.
7. Udfør handlinger: AI, der kan tale, er cool, og AI, der kan udføre handlinger, er endnu mere cool. Dette opnås normalt med function calling-funktionaliteter i visse modeller eller struktureret dataoutput, så downstream kan booke møder, når det er nødvendigt, og kan slå information op, når det er passende.
Jeg tror, de fleste folk på nuværende tidspunkt vil være enige i, at dette ikke er så nemt som at sy ASR, LLM, TTS sammen. Så lad mig (skamløst) introducere, hvordan Retell AI kan hjælpe her. Ved at integrere med Retell AI kan du spare måneders udvikling, nyde en topmoderne stemmeoplevelse og få alt følgende dækket:
Hvad du skal gøre: fortsæt med at iterere på dit kerneprodukt for at gøre det bedre, mens vi tager os af lyddelen. Her er de dele, du skal arbejde på:
Jeg håber, denne blog kan give dig en overordnet idé om, hvordan man bygger en god stemmeagent, og forhåbentlig (og skamløst) kan mit pitch for Retell AI kaste lys over, hvordan vi kan hjælpe.
God fornøjelse med byggeriet!
See how much your business could save by switching to AI-powered voice agents.
Total Human Agent Cost
AI Agent Cost
Estimated Savings
Et demonummer fra Retell Clinic Office

Start building smarter conversations today.


.avif)
.avif)