So bauen Sie einen guten Sprachagenten

So bauen Sie einen guten Sprachagenten
ZURÜCK ZU DEN BLOGS
AUF DIESER SEITE
Nach oben

Mit dem Fortschritt der generativen KI haben wir ein erhebliches Wachstum bei Chatbot-Produkten beobachtet, die den Markt dominieren. Gleichzeitig hat sich die Sprach-KI so weit verbessert, dass reibungslose Gespräche mit KI nun möglich sind. Ob Sie KI für eingehende und ausgehende Anrufe, professionelle Dienstleistungen, Companion-Apps usw. entwickeln – die Stimme bleibt ein zentraler Bestandteil des Erlebnisses und ist wichtig für die Conversion. Wir alle können uns an frustrierende Erfahrungen mit KI während Anrufen erinnern – roboterhafte Stimmen, unangenehme Schweigepausen, lange Latenzzeiten und die Notwendigkeit, Tasten zu drücken, um zu interagieren, was zusammengenommen die menschenähnliche Qualität des Erlebnisses schmälert und gelegentlich die Nutzer verärgert.

Was ist der Unterschied zwischen Sprach-KI und Mensch?

Bevor wir uns damit befassen, wie man ein großartiges Spracherlebnis aufbaut, wollen wir kurz zusammenfassen, wie ein Mensch normalerweise in einem Gespräch interagiert. Wir arbeiten mit einer Latenz von <200 ms, wenn der Sprecherwechsel stattfindet, wir geben bei Bedarf Backchannel-Signale, wir verstehen unbewusst, wann die andere Partei ihren Redebeitrag beendet, wir verstehen die Bedeutung und Emotionen der anderen Partei, wir haben Füllwörter in unseren Sätzen, wir hören auf zu reden, wenn wir unterbrochen werden ... Die Liste ließe sich fortsetzen, aber der wesentliche Punkt, den ich hier mache, ist, dass im Hintergrund so viele kleine Mechanismen ablaufen, wenn wir ein einfaches, reibungsloses Gespräch führen, und es ist für Maschinen extrem SCHWER, all dies zu berücksichtigen und wie Menschen zu agieren.

Warum ist es schwer, eine gute konversationelle Sprach-KI zu bauen?

Eine häufige Frage, die uns oft gestellt wird, ist, warum ich die Retell API verwenden muss – Kann ich nicht einfach ASR (Speech-to-Text), LLM, TTS (Text-to-Speech) zusammenfügen, um ein Sprachgespräch aufzubauen?

Nun, hmm, das sollten Sie durchaus tun, wenn Sie die Zeit haben, und sehen, wie weit Sie ein einfacher Zusammenfügungsansatz bringt. Das häufigste Problem, das wir von denjenigen hören, die ihr eigenes Sprachsystem bauen, ist, dass es schwer ist, die Latenz zu reduzieren; das zweithäufigste Problem, das wir sehen, ist, dass die Handhabung von Unterbrechungen mit einem einfachen Setup schwer zu implementieren ist; das dritthäufigste Problem, das wir sehen, ist, dass die Antwort des Agenten nicht konversationell genug ist, um wie ein Mensch zu klingen. Um all dies anzugehen, wollen wir einen Überblick darüber geben, welche Komponenten vorhanden sein müssen und welche Arbeit für ein gutes konversationelles Sprach-KI-Erlebnis geleistet werden muss.

1. Integrieren Sie mit Web-Frontend oder programmierbaren Kommunikationstools wie Twilio, Vonage, um Nutzer-Audio zu erhalten.

2. Arbeiten Sie mit Audio-Bytes und Streaming-Protokollen: Nutzer-Audio von verschiedenen Frontends (Web, Telefonanruf) kommt in unterschiedlichen Kodierungen, Formaten an und wird über verschiedene Streaming-Protokolle gesendet. Dies ist eine anstrengende Aufgabe, da Audio-Bytes schwer zu manipulieren und zeitaufwendig in der Bearbeitung sind. Fragen Sie einen beliebigen Ingenieur, den Sie kennen und der mit Audiosignalen arbeitet; er wird dieselbe Aussage teilen.

3. Verstehen Sie das Audio: Es gibt verschiedene Signale aus dem Audio, die für ein reibungsloses Gespräch entscheidend sind.

  • Text: wird normalerweise aus ASR (asynchrone Spracherkennung) generiert, muss gestreamt werden, muss so schnell und genau wie möglich sein.
  • Emotion: das Verständnis des emotionalen Zustands der anderen Partei ist für Menschen entscheidend, um eine gute Antwort im Gespräch zu geben.
  • Audiosignalqualität: ob Hintergrundgeräusche vorhanden sind, ob es ein Echo gibt.
  • Sprecherdiarisierung: wenn mehrere Personen sprechen, die Sprecheridentität erkennen und identifizieren, wer mit Ihnen spricht und wer nicht usw.
  • Tonalität und andere sprecherspezifische Merkmale.
  • Pause: ob der Nutzer aufhört zu sprechen, normalerweise abgeleitet aus VAD (Voice Activity Detection).

4. Entscheiden Sie, ob gesprochen werden soll: verstehen, ob die andere Partei ihren Redebeitrag bald beenden wird oder ihn bereits beendet hat, ob sie eine Antwort erwartet oder nur pausiert, um ihre Gedanken zu formulieren usw. Es müssen Text, Emotion, Tonalität, Pause und andere Audio-Eingaben kombiniert werden, um diese Entscheidung zu generieren.

  • Das Knifflige daran ist, dass Nutzer an jeder Stelle enden können, wenn Sie sie nicht persönlich gut kennen, und die KI muss auf diese abrupten Enden vorbereitet sein.
  • Dass Nutzer unerwartet weitersprechen, ist weniger ein Problem, da die KI einfach weiter zuhören und die Entscheidung zu sprechen zurücknehmen kann.

5. Generieren der Antworten: Eine gute Antwort auf das zu generieren, was der Nutzer gesagt hat, ist schwer und sehr szenariospezifisch. Es gibt verschiedene Möglichkeiten, diesen Teil zu erledigen, und er ist für jeden Anwendungsfall angepasst, daher werde ich hier nur einen einfachen Ablauf der Antwortgenerierung teilen.

  • RAG (Retrieval Augmented Generation): Bettet Dokumente, Daten, Wissensdatenbank usw. in eine Vektordatenbank ein und ruft nur die relevanten Informationen daraus ab. Diese relevanten Informationen werden Teil des Prompts, der in das LLM eingespeist wird.
  • LLM: Dies kann ein feinabgestimmtes, selbst gehostetes Modell sein oder API-Aufrufe an Anbieter. Generieren Sie basierend auf den relevanten Informationen aus dem letzten Schritt und einigen anderen für den Nutzer angepassten Prompts eine Antwort und streamen Sie die Antwort zurück an ein Sprachgenerierungssystem.
  • Verifizierung: bei bestimmten kritischen Phrasen/Wörtern eventuell vor dem Zurückstreamen verifizieren.

6. Synthetisieren Sie das Audio: Wird normalerweise mit TTS-Modellen (Text-to-Speech) erreicht, wandelt den Antworttext in Audio um. Muss Ton- und Emotionsvariationen aufweisen, die zum Szenario passen, um menschenähnlich zu sein. Idealerweise sollte die TTS-Ausgabe für geringere Latenz zurückgestreamt werden.

7. Aktionen ausführen: KI, die sprechen kann, ist cool, und KI, die Aktionen ausführen kann, ist cooler. Dies wird normalerweise mit Function-Calling-Funktionen bestimmter Modelle oder strukturierter Datenausgabe erreicht, sodass nachgelagert bei Bedarf Termine gebucht und bei Bedarf Informationen nachgeschlagen werden können.

  • Stellen Sie beim Ausführen von Aktionen sicher, dass Ihr Agent weiterhin antworten kann.
  • Ein spezifischer Anwendungsfall hierfür ist die Anrufweiterleitung oder das Beenden des Anrufs.

Was kann die Retell AI für eine gute konversationelle Sprach-KI tun?

Ich denke, mittlerweile würden die meisten zustimmen, dass dies nicht so einfach ist wie das Zusammenfügen von ASR, LLM, TTS. Deshalb lassen Sie mich (schamlos) vorstellen, wie die Retell AI hier helfen kann. Durch die Integration mit der Retell AI können Sie Monate der Entwicklung sparen, ein hochmodernes Spracherlebnis genießen und alles Folgende abdecken:

  • Niedrige Latenz: Wir wenden Optimierungen bei jedem Schritt an, sodass die Latenz für den Audio-Teil auf das Minimum reduziert wird. Beachten Sie, dass der Teil der Antwortgenerierung weiterhin in Ihren Händen liegt, wir also wenig Kontrolle darüber haben. Unsere Demo liegt bei ~800 ms zwischen dem Moment, in dem der Nutzer aufhört, und der Antwort des Agenten.
  • Handhabung von Unterbrechungen: Der Nutzer kann jederzeit unterbrechen, und der Agent reagiert darauf blitzschnell wie ein echter Mensch.
  • Audio-Integration: Wir können uns direkt mit Twilio verbinden, und wir haben Web-Frontend-Code als Open Source veröffentlicht.
  • Arbeit mit Audio-Bytes: Wir haben das im Griff und können Ihnen Hunderte von Stunden sparen.
  • Audioverständnis: Wir gewinnen Erkenntnisse aus Audio mit der geringsten Latenz und senden Ihnen Echtzeit-Transkripte (weitere Signale folgen in Kürze).
  • Entscheidung, wann gesprochen wird: Wir haben unser eigenes Turn-Taking-Modell und werden es kontinuierlich iterieren, um bessere Entscheidungen darüber zu treffen, wann gesprochen wird.
  • Audiosynthese: Wir integrieren mit verschiedenen TTS-Anbietern und haben Sprecher engagiert, um menschenähnliche, für Gespräche geeignete Stimmen zu erstellen.
  • Schnelle Demo & Dashboard: Wir haben unser Dashboard so eingerichtet, dass die Erstellung einer Demo innerhalb von 2 Minuten unterstützt wird.
  • Fachwissen & Support: Wir verfügen über Fachwissen in den Bereichen Audio, Modellierung und Agentenerstellung. Wir sind hier, um zu helfen, wann immer Sie auf Probleme stoßen.

Was Sie tun müssen: Iterieren Sie kontinuierlich an Ihrem Kernprodukt, um es zu verbessern, während wir uns um den Audio-Teil kümmern. Hier sind die Teile, an denen Sie arbeiten müssen:

  • Antwortgenerierung: Obwohl wir die Erstellung von Demos im Dashboard unterstützen, ist uns bewusst, dass der Prozess der Antwortgenerierung für jedes Szenario drastisch unterschiedlich sein kann. Daher wird unsere API Ihre benutzerdefinierte Lösung zur Antwortgenerierung problemlos integrieren, egal ob es sich um einen einfachen OpenAI-Aufruf oder ein kompliziertes Agenten-Setup handelt.
  • Aktionen ausführen: Damit der Sprachagent Aktionen ausführen kann, müssen Sie wahrscheinlich mit verschiedenen Tools integrieren (Kalender, CRM usw.). Es liegt an Ihnen zu entscheiden, wann welche Aktion ausgeführt wird und welche. Vergessen Sie nicht, während des Ausführens von Aktionen weiterhin Antworten zu generieren.
  • Spezifische Anruflogik: Verschiedene Anwendungsfälle leiten Anrufe weiter / beenden sie unterschiedlich, und es liegt an Ihnen, die Details zum Call Flow zu entscheiden. Dies kann über Function Calling eingerichtet werden.

Ich hoffe, dieser Blog kann Ihnen eine übergeordnete Vorstellung davon geben, wie man einen großartigen Sprachagenten baut, und hoffentlich (und schamlos) kann mein Plädoyer für die Retell AI Licht darauf werfen, wie wir helfen können.

Viel Freude beim Bauen!

ROI-Rechner
Schätzen Sie Ihren ROI durch die Automatisierung von Anrufen

Sehen Sie, wie viel Ihr Unternehmen durch den Wechsel zu KI-gestützten Sprachagenten sparen könnte.

Fertig! 
Ihre Anfrage wurde an Ihre E-Mail-Adresse gesendet
Hoppla! Beim Absenden des Formulars ist ein Fehler aufgetreten.
   1
   8
20
Hoppla! Beim Absenden des Formulars ist ein Fehler aufgetreten.

ROI-Ergebnis

2,000

Total Human Agent Cost

$5,000
/month

AI Agent Cost

$3,000
/month

Estimated Savings

$2,000
/month
Live-Demo
Unsere Live-Demo ausprobieren

Eine Demo-Telefonnummer von Retell Clinic Office

Vielen Dank! Ihre Anfrage wurde erfolgreich übermittelt!
Ups! Beim Absenden des Formulars ist ein Fehler aufgetreten.

Read Other Blogs

Revolutionize your call operation with Retell