So bauen Sie einen guten Sprachagenten



Mit dem Fortschritt der generativen KI haben wir ein erhebliches Wachstum bei Chatbot-Produkten beobachtet, die den Markt dominieren. Gleichzeitig hat sich die Sprach-KI so weit verbessert, dass reibungslose Gespräche mit KI nun möglich sind. Ob Sie KI für eingehende und ausgehende Anrufe, professionelle Dienstleistungen, Companion-Apps usw. entwickeln – die Stimme bleibt ein zentraler Bestandteil des Erlebnisses und ist wichtig für die Conversion. Wir alle können uns an frustrierende Erfahrungen mit KI während Anrufen erinnern – roboterhafte Stimmen, unangenehme Schweigepausen, lange Latenzzeiten und die Notwendigkeit, Tasten zu drücken, um zu interagieren, was zusammengenommen die menschenähnliche Qualität des Erlebnisses schmälert und gelegentlich die Nutzer verärgert.
Bevor wir uns damit befassen, wie man ein großartiges Spracherlebnis aufbaut, wollen wir kurz zusammenfassen, wie ein Mensch normalerweise in einem Gespräch interagiert. Wir arbeiten mit einer Latenz von <200 ms, wenn der Sprecherwechsel stattfindet, wir geben bei Bedarf Backchannel-Signale, wir verstehen unbewusst, wann die andere Partei ihren Redebeitrag beendet, wir verstehen die Bedeutung und Emotionen der anderen Partei, wir haben Füllwörter in unseren Sätzen, wir hören auf zu reden, wenn wir unterbrochen werden ... Die Liste ließe sich fortsetzen, aber der wesentliche Punkt, den ich hier mache, ist, dass im Hintergrund so viele kleine Mechanismen ablaufen, wenn wir ein einfaches, reibungsloses Gespräch führen, und es ist für Maschinen extrem SCHWER, all dies zu berücksichtigen und wie Menschen zu agieren.

Eine häufige Frage, die uns oft gestellt wird, ist, warum ich die Retell API verwenden muss – Kann ich nicht einfach ASR (Speech-to-Text), LLM, TTS (Text-to-Speech) zusammenfügen, um ein Sprachgespräch aufzubauen?
Nun, hmm, das sollten Sie durchaus tun, wenn Sie die Zeit haben, und sehen, wie weit Sie ein einfacher Zusammenfügungsansatz bringt. Das häufigste Problem, das wir von denjenigen hören, die ihr eigenes Sprachsystem bauen, ist, dass es schwer ist, die Latenz zu reduzieren; das zweithäufigste Problem, das wir sehen, ist, dass die Handhabung von Unterbrechungen mit einem einfachen Setup schwer zu implementieren ist; das dritthäufigste Problem, das wir sehen, ist, dass die Antwort des Agenten nicht konversationell genug ist, um wie ein Mensch zu klingen. Um all dies anzugehen, wollen wir einen Überblick darüber geben, welche Komponenten vorhanden sein müssen und welche Arbeit für ein gutes konversationelles Sprach-KI-Erlebnis geleistet werden muss.
1. Integrieren Sie mit Web-Frontend oder programmierbaren Kommunikationstools wie Twilio, Vonage, um Nutzer-Audio zu erhalten.
2. Arbeiten Sie mit Audio-Bytes und Streaming-Protokollen: Nutzer-Audio von verschiedenen Frontends (Web, Telefonanruf) kommt in unterschiedlichen Kodierungen, Formaten an und wird über verschiedene Streaming-Protokolle gesendet. Dies ist eine anstrengende Aufgabe, da Audio-Bytes schwer zu manipulieren und zeitaufwendig in der Bearbeitung sind. Fragen Sie einen beliebigen Ingenieur, den Sie kennen und der mit Audiosignalen arbeitet; er wird dieselbe Aussage teilen.
3. Verstehen Sie das Audio: Es gibt verschiedene Signale aus dem Audio, die für ein reibungsloses Gespräch entscheidend sind.
4. Entscheiden Sie, ob gesprochen werden soll: verstehen, ob die andere Partei ihren Redebeitrag bald beenden wird oder ihn bereits beendet hat, ob sie eine Antwort erwartet oder nur pausiert, um ihre Gedanken zu formulieren usw. Es müssen Text, Emotion, Tonalität, Pause und andere Audio-Eingaben kombiniert werden, um diese Entscheidung zu generieren.
5. Generieren der Antworten: Eine gute Antwort auf das zu generieren, was der Nutzer gesagt hat, ist schwer und sehr szenariospezifisch. Es gibt verschiedene Möglichkeiten, diesen Teil zu erledigen, und er ist für jeden Anwendungsfall angepasst, daher werde ich hier nur einen einfachen Ablauf der Antwortgenerierung teilen.
6. Synthetisieren Sie das Audio: Wird normalerweise mit TTS-Modellen (Text-to-Speech) erreicht, wandelt den Antworttext in Audio um. Muss Ton- und Emotionsvariationen aufweisen, die zum Szenario passen, um menschenähnlich zu sein. Idealerweise sollte die TTS-Ausgabe für geringere Latenz zurückgestreamt werden.
7. Aktionen ausführen: KI, die sprechen kann, ist cool, und KI, die Aktionen ausführen kann, ist cooler. Dies wird normalerweise mit Function-Calling-Funktionen bestimmter Modelle oder strukturierter Datenausgabe erreicht, sodass nachgelagert bei Bedarf Termine gebucht und bei Bedarf Informationen nachgeschlagen werden können.
Ich denke, mittlerweile würden die meisten zustimmen, dass dies nicht so einfach ist wie das Zusammenfügen von ASR, LLM, TTS. Deshalb lassen Sie mich (schamlos) vorstellen, wie die Retell AI hier helfen kann. Durch die Integration mit der Retell AI können Sie Monate der Entwicklung sparen, ein hochmodernes Spracherlebnis genießen und alles Folgende abdecken:
Was Sie tun müssen: Iterieren Sie kontinuierlich an Ihrem Kernprodukt, um es zu verbessern, während wir uns um den Audio-Teil kümmern. Hier sind die Teile, an denen Sie arbeiten müssen:
Ich hoffe, dieser Blog kann Ihnen eine übergeordnete Vorstellung davon geben, wie man einen großartigen Sprachagenten baut, und hoffentlich (und schamlos) kann mein Plädoyer für die Retell AI Licht darauf werfen, wie wir helfen können.
Viel Freude beim Bauen!
Sehen Sie, wie viel Ihr Unternehmen durch den Wechsel zu KI-gestützten Sprachagenten sparen könnte.
Total Human Agent Cost
AI Agent Cost
Estimated Savings
Eine Demo-Telefonnummer von Retell Clinic Office

Start building smarter conversations today.


.avif)
.avif)