Hoe bouw je een goede stemagent



Met de opkomst van generatieve AI hebben we een aanzienlijke groei gezien in chatbotproducten die de markt domineren. Tegelijkertijd is voice-AI zo verbeterd dat vloeiende gesprekken met AI nu haalbaar zijn. Of je nu AI bouwt voor inkomende en uitgaande gesprekken, professionele diensten, companion-apps enzovoort, stem blijft een kernonderdeel van de ervaring en is belangrijk voor conversie. We kennen allemaal de frustrerende ervaringen met AI tijdens gesprekken — robotachtige stemmen, ongemakkelijke stiltes, lange latency, en de noodzaak om op knoppen te drukken om te communiceren, wat samen de natuurlijk klinkende kwaliteit van de ervaring vermindert en gebruikers af en toe irriteert.
Voordat we duiken in hoe je een geweldige stemervaring bouwt, laten we even recapituleren hoe een mens zich doorgaans gedraagt in een gesprek. We opereren met <200ms latency bij het beurtwisselen, we geven waar nodig backchannel-signalen, we begrijpen onbewust wanneer de andere partij zijn beurt afrondt, we begrijpen de betekenis en emoties van de andere partij, we hebben stopwoorden in onze zinnen, we stoppen met praten wanneer we onderbroken worden... De lijst gaat maar door, maar de essentie die ik hier maak is dat er zoveel kleine mechanismen op de achtergrond gebeuren wanneer we een eenvoudig, vloeiend gesprek voeren, en het is extreem MOEILIJK voor machines om al deze in overweging te nemen en zich als mensen te gedragen.

Een veelgestelde vraag die we krijgen is waarom ik de Retell API moet gebruiken --Kan ik niet gewoon ASR (speech-to-text), LLM, TTS (text-to-speech) aan elkaar knopen om een stemgesprek te bouwen?
Nou, hmm, dat zou je zeker moeten doen als je de tijd hebt, en kijken hoe ver een eenvoudige aan-elkaar-knopen-aanpak je brengt. Het nummer één probleem dat we horen van degenen die hun eigen stemsysteem maken is dat het moeilijk is om latency terug te dringen; het nummer twee probleem dat we zien is dat het afhandelen van onderbrekingen moeilijk te implementeren is met een eenvoudige opzet; het nummer drie probleem dat we zien is dat de reactie van de agent niet conversationeel genoeg is om als een mens te klinken. Om dit alles aan te pakken, laten we een overzicht doornemen van welke componenten aanwezig moeten zijn en welk werk gedaan moet worden voor een goede conversationele voice-AI-ervaring.
1. Integreer met een webfrontend of programmeerbare communicatietools zoals Twilio, Vonage om audio van de gebruiker te verkrijgen.
2. Werk met audiobytes en streamingprotocollen: Gebruikersaudio van verschillende frontends (web, telefoongesprek) komt binnen in verschillende encoderingen, formaten, en wordt verzonden via verschillende streamingprotocollen. Dit is een zware taak, aangezien audiobytes moeilijk te manipuleren en tijdrovend zijn om mee te werken. Vraag het aan een willekeurige engineer die je kent die met audiosignalen werkt; die zal hetzelfde beamen.
3. Begrijp de audio: Er zijn verschillende signalen uit audio die essentieel zijn voor een vloeiend gesprek.
4. Beslis of je gaat spreken: begrijp of de andere partij zijn beurt binnenkort zal afronden, of dat ze die al hebben afgerond, of ze een reactie afwachten of gewoon pauzeren om hun gedachten te formuleren, enzovoort. Moet tekst, emotie, tonaliteit, pauze en andere audio-input combineren om deze beslissing te genereren.
5. De reacties genereren: Een goede reactie genereren op wat de gebruiker heeft gezegd is moeilijk, en zeer scenario-specifiek. Er zijn verschillende manieren om dit onderdeel te doen en het wordt aangepast voor elke use case, dus hier deel ik gewoon één eenvoudige flow van reactiegeneratie.
6. Synthetiseer de audio: Meestal bereikt met TTS-modellen (text to speech), zet de reactietekst om in audio. Moet toon- en emotievariatie hebben die past bij het scenario om natuurlijk klinkend te zijn. Idealiter zou de TTS-output teruggestreamd moeten worden voor lagere latency.
7. Acties ondernemen: AI die kan praten is cool, en AI die acties kan ondernemen is nog cooler. Dit wordt meestal bereikt met function-calling-functionaliteiten van bepaalde modellen, of gestructureerde data-output, zodat downstream afspraken kan inplannen wanneer nodig, en informatie kan opzoeken waar gepast.
Ik denk dat de meesten inmiddels het erover eens zijn dat dit niet zo eenvoudig is als ASR, LLM, TTS aan elkaar knopen. Laat me daarom (schaamteloos) introduceren hoe Retell AI hier kan helpen. Door te integreren met Retell AI kun je maanden ontwikkeling besparen, genieten van een state-of-the-art stemervaring, en al het volgende afgedekt krijgen:
Wat jij moet doen: blijf je kernproduct itereren om het beter te maken, terwijl wij zorgen voor het audiogedeelte. Hier zijn de onderdelen waaraan je moet werken:
Ik hoop dat deze blog je een globaal idee kan geven van hoe je een geweldige stemagent bouwt, en hopelijk (en schaamteloos) kan mijn pitch voor Retell AI licht werpen op hoe wij kunnen helpen.
Veel bouwplezier!
See how much your business could save by switching to AI-powered voice agents.
Total Human Agent Cost
AI Agent Cost
Estimated Savings
Een demodemonummer van Retell Clinic Office

Start building smarter conversations today.


.avif)
.avif)