Wie KI-Sprachagenten die betreute Weiterleitung perfektionieren: Die Lücke zwischen KI und menschlichen Agenten schließen

Wie KI-Sprachagenten die betreute Weiterleitung perfektionieren: Die Lücke zwischen KI und menschlichen Agenten schließen
ZURÜCK ZU DEN BLOGS
AUF DIESER SEITE
Nach oben

KI-Sprachagenten sind mittlerweile in der Lage, einen großen Teil echter Kundengespräche zu bewältigen, Supportfragen zu beantworten, Termine zu vereinbaren, Leads zu qualifizieren und hohe Volumina eingehender Anrufe zu verwalten. Produktivbereitstellungen offenbaren jedoch einen konsistenten Bruchpunkt: den Moment, in dem die KI das Gespräch an einen menschlichen Agenten übergeben muss.

Dieser Übergang war historisch gesehen der Punkt, an dem automatisierte Anrufsysteme versagten. Der Kontext verschwindet, Kunden wiederholen sich, und menschliche Agenten steigen in das Gespräch ein, ohne zu wissen, was bereits passiert ist.

Das Problem ist nicht, dass die KI keine Gespräche führen kann. Das Problem ist, dass die meisten Systeme nie dafür konzipiert wurden, diese Gespräche ordnungsgemäß zu übergeben.

Moderne KI-Sprachagenten und insbesondere die Retell AI lösen dies, indem sie betreute Weiterleitungen ermöglichen, die den Gesprächskontext bewahren, sodass Automatisierung und menschliche Agenten als Teil desselben Gesprächs agieren können und nicht als zwei getrennte Systeme.

Warum die Übergabe zwischen Mensch und KI in der konversationellen KI ein hartnäckiges Problem war

Seit Jahren versprechen konversationelle KI-Systeme, Kundeninteraktionen zu automatisieren. Und in vielen Fällen tun sie das auch – zumindest für den ersten Teil des Gesprächs. Die Schwierigkeit beginnt, wenn das System an die Grenzen dessen stößt, was es lösen kann.

In echten Anrufumgebungen kommt es häufig zu Eskalationen. Ein Kunde fragt nach etwas außerhalb des automatisierten Workflows. Ein technisches Problem erfordert menschliches Urteilsvermögen. Ein Anrufer wird frustriert und möchte mit einer Person sprechen.

Wenn dieser Moment eintritt, haben die meisten konversationellen KI-Systeme Schwierigkeiten, die Interaktion reibungslos zu gestalten. Mehrere strukturelle Probleme erklären, warum das so ist.

1. Der Kontext verschwindet häufig während der Eskalation

Viele Sprachautomatisierungssysteme behandeln die Eskalation als einfaches Routing-Ereignis. Sobald die KI entscheidet, dass sie die Anfrage nicht lösen kann, wird der Anruf an eine andere Warteschlange oder Abteilung weitergeleitet.

Die während des Gesprächs gesammelten Informationen – die Absicht des Anrufers, Kontodetails und frühere Antworten – gehen dabei oft verloren. Aus Sicht des Kunden beginnt das Gespräch von vorne.

2. Menschliche Agenten erhalten keinen Gesprächshintergrund

Wenn ein menschlicher Agent den Anruf entgegennimmt, beginnt er in der Regel mit einer Standardbegrüßung: „Wie kann ich Ihnen heute helfen?“ Doch der Kunde hat bereits mehrere Minuten damit verbracht, der KI die Situation zu erklären.

Das Ergebnis ist eine bekannte Frustration bei automatisierten Anrufsystemen: Kunden müssen alles wiederholen, was sie bereits gesagt haben.

3. Kalte Weiterleitungen stören den Fluss von Sprachgesprächen

Sprachinteraktionen sind kontinuierlich und zeitkritisch. Wenn eine Eskalation diesen Fluss unterbricht, wirkt der Übergang abrupt. Anders als bei Chat-Schnittstellen, wo Agenten den Nachrichtenverlauf schnell lesen können, erfordern Telefonanrufe ein sofortiges Verständnis der Situation.

Ohne Kontext muss der menschliche Agent das Gespräch von Grund auf neu rekonstruieren.

4. Eskalationsmodelle von Chatbots lassen sich nicht gut auf Sprache übertragen

Ein weiterer Grund, warum dieses Problem fortbesteht, ist, dass viele konversationelle KI-Plattformen aus der Chatbot-Technologie hervorgegangen sind. In Chat-Umgebungen ist die Eskalation einfacher, weil Nachrichtenverläufe sichtbar sind. Agenten können das Transkript vor der Antwort einsehen.

Sprachinteraktionen bieten diesen Luxus nicht. Bis der menschliche Agent dem Anruf beitritt, hat das Gespräch bereits stattgefunden – und sofern das System diesen Kontext nicht bewahrt hat, ist er verloren.

Kalte Weiterleitung vs. betreute Weiterleitung in der Sprach-KI

Um zu verstehen, wie sich Sprach-KI-Systeme weiterentwickeln, hilft es, den Unterschied zwischen kalten und betreuten Weiterleitungen zu betrachten. Diese beiden Ansätze stellen grundlegend unterschiedliche Arten dar, mit Eskalation umzugehen.

Kalte Weiterleitung

Eine kalte Weiterleitung liegt vor, wenn ein System einen Anruf ohne beigefügte Kontextinformationen an einen anderen Agenten oder eine andere Abteilung weiterleitet.

Technisch gesehen ist der Prozess einfach:

  1. Die KI stellt fest, dass sie die Anfrage nicht lösen kann.
  2. Das System leitet den Anruf an den nächsten verfügbaren menschlichen Agenten weiter.
  3. Der Agent nimmt den Anruf entgegen, ohne zu wissen, was zuvor passiert ist.

Kalte Weiterleitungen sind bei klassischen IVR-Systemen und frühen konversationellen KI-Bereitstellungen üblich, weil sie leicht umzusetzen sind. Sie führen jedoch zu erheblicher Reibung.

Kunden müssen ihr Problem wiederholen. Agenten müssen Zeit damit verbringen, Informationen erneut zu sammeln, die die KI bereits erhoben hat. Die gesamte Interaktion wird faktisch zurückgesetzt. Für Organisationen, die täglich Tausende von Anrufen bearbeiten, summiert sich diese Ineffizienz schnell.

Betreute Weiterleitung

Betreute Weiterleitungen verfolgen einen grundlegend anderen Ansatz. Anstatt den Anruf einfach weiterzuleiten, versorgt die KI den empfangenden Agenten mit dem relevanten Kontext, bevor die Verbindung hergestellt wird.

Dieser Kontext umfasst in der Regel:

  • eine Zusammenfassung des Gesprächs
  • die Absicht des Anrufers
  • bereits gesammelte Informationen
  • den Grund für die Eskalation

Dies spiegelt das Verhalten erfahrener menschlicher Empfangskräfte wider, die Anrufer vorstellen, bevor sie sie mit einem anderen Agenten verbinden. Bei korrekter Umsetzung ermöglichen betreute Weiterleitungen, dass das Gespräch nahtlos fortgesetzt wird, anstatt neu zu beginnen. Der menschliche Agent steigt mit sofortigem Situationsbewusstsein in die Interaktion ein.

Genau diese Art von Übergang soll die Retell AI ermöglichen.

Warum Eskalation in der Sprach-KI komplexer ist als die Übergabe bei Chatbots

Eskalation ist in Sprachsystemen von Natur aus schwieriger als in chatbasierten Schnittstellen. Diese Herausforderungen erklären, warum die Konzeption zuverlässiger Übergabemechanismen zwischen Mensch und KI historisch gesehen eines der schwierigsten Engineering-Probleme in der Sprachautomatisierung war.

Sprachgespräche finden in Echtzeit statt

In Chat-Systemen können Agenten den Gesprächsverlauf vor der Antwort einsehen. Sprachinteraktionen erlauben diese Pause nicht. Wenn ein menschlicher Agent dem Anruf beitritt, muss er die Situation sofort verstehen. Jede Verwirrung fällt dem Anrufer auf.

Emotionaler Kontext ist in der Sprache eingebettet

Tonfall, Tempo und Zögern übermitteln emotionale Signale. Wenn die Eskalation Kunden zwingt, sich zu wiederholen, eskaliert oft auch die Frustration. Eine schlecht ausgeführte Weiterleitung kann eine ansonsten handhabbare Interaktion in ein negatives Erlebnis verwandeln.

Der Zeitpunkt der Eskalation ist entscheidend

KI-Systeme müssen erkennen, wann das Gespräch eskaliert werden sollte. Erfolgt die Eskalation zu früh, sinkt der Wert der Automatisierung. Erfolgt die Eskalation zu spät, wird die Interaktion frustrierend. KI-Sprachagenten müssen daher Eskalationsauslöser präzise erkennen.

Gespräche verlaufen selten linear

Menschliche Sprache umfasst Unterbrechungen, Klärungen und wechselnde Absichten. Sprach-KI-Systeme müssen diese Gesprächsdynamiken verfolgen und gleichzeitig ein internes Verständnis der Interaktion aufrechterhalten.

Wenn eine Eskalation eintritt, muss dieser gesamte Gesprächszustand bewahrt werden. Ohne ihn steigt der menschliche Agent blind in die Interaktion ein.

Wie moderne Sprach-KI-Systeme betreute Weiterleitungen ausführen

Das Aufkommen moderner Sprach-KI-Plattformen hat zu neuen Ansätzen für die Lösung des Übergabeproblems geführt. Die betreute Weiterleitung ist keine einzelne Funktion. Sie ist das Ergebnis mehrerer koordinierter Systemfähigkeiten, die während laufender Gespräche zusammenarbeiten.

Die meisten modernen Implementierungen folgen einem ähnlichen Ausführungsablauf.

1. Erkennung von Eskalationsauslösern

Der KI-Agent überwacht das Gespräch kontinuierlich auf Signale, dass eine Eskalation erforderlich ist.

Diese Signale können umfassen:

  • Anfragen außerhalb unterstützter Workflows
  • wiederholte Missverständnisse
  • komplexe oder sensible Probleme
  • ausdrückliche Bitten, mit einem Menschen zu sprechen

Sobald das System einen Auslöser erkennt, bereitet es den Eskalationsprozess vor.

2. Erfassung des Gesprächszustands

Bevor der Anruf weitergeleitet wird, erfasst das System den strukturierten Zustand des Gesprächs.

Dazu gehören Informationen wie:

  • die Absicht des Anrufers
  • wichtige während der Interaktion gesammelte Details
  • die Phase des Gesprächs
  • bereits versuchte Aktionen

Die Bewahrung dieses Zustands ist entscheidend, um eine sinnvolle Übergabe zu ermöglichen.

3. Erstellung einer Kontextzusammenfassung

Anstatt rohe Transkripte an menschliche Agenten weiterzugeben, erstellen fortschrittliche Sprach-KI-Systeme prägnante Zusammenfassungen, die die Situation erklären.

Zum Beispiel:

„Anrufer versucht, einen Termin zu verschieben. Keine Verfügbarkeit im gewünschten Zeitfenster gefunden. Eskalation an menschlichen Terminplaner.“

So können Agenten den Kontext schnell verstehen, bevor sie sprechen.

4. Weiterleitung des Anrufs an den richtigen Agenten

Sobald das Kontextpaket vorbereitet ist, leitet das System den Anruf anhand von Faktoren wie den folgenden weiter:

  • Abteilung
  • Kompetenzanforderungen
  • Verfügbarkeit der Agenten
  • Eskalationsrichtlinien

Diese Weiterleitung muss in Echtzeit erfolgen, ohne das Gespräch zu unterbrechen.

5. Übermittlung des Kontexts an den empfangenden Agenten

Wenn der menschliche Agent den Anruf erhält, stellt das System die Gesprächszusammenfassung und relevante Details bereit.

Anstatt mit „Wie kann ich Ihnen helfen?“ zu beginnen, kann der Agent das Gespräch natürlich fortsetzen:

„Ich sehe, dass Sie versucht haben, Ihren Termin zu verschieben, aber das System konnte keine Verfügbarkeit finden. Lassen Sie mich Ihnen dabei helfen.“

Aus Sicht des Anrufers wurde das Gespräch nie neu gestartet. Es wurde einfach mit der richtigen Person fortgesetzt. Diese Architektur ist die Grundlage für eine zuverlässige Zusammenarbeit zwischen Mensch und KI in der Sprachautomatisierung.

Zuverlässige Übergabe zwischen Mensch und KI gestalten: Wie die Retell AI die betreute Weiterleitung in die Infrastruktur von Sprachagenten integriert hat

Die Retell AI wurde mit einer grundlegenden Annahme über echte Anrufautomatisierung konzipiert: Sprachagenten werden nicht jedes Gespräch allein bewältigen. Das System muss in der Lage sein, einen menschlichen Agenten einzubinden, ohne die Interaktion zu unterbrechen.

Anstatt die Eskalation als einfache Anrufweiterleitung zu behandeln, integriert die Retell AI die betreute Weiterleitung direkt in die Architektur ihrer Sprachagenten und ermöglicht so, dass Automatisierung und menschliche Bediener innerhalb desselben Gesprächsworkflows arbeiten.

Im Zentrum dieses Designs steht die persistente Gesprächszustandsschicht von Retell, die die Struktur und den Fortschritt der Interaktion kontinuierlich verfolgt, während der Anruf läuft. Das System bewahrt während des gesamten Gesprächs das kontextuelle Bewusstsein, einschließlich:

  • Der Absicht und Anfrage des Anrufers
  • Bereits vom KI-Agenten gesammelter Informationen
  • Des aktuellen Schritts im Workflow oder in der Aufgabe
  • Bereits versuchter Systemaktionen
  • Signale, die anzeigen, wann eine Eskalation angemessen sein könnte

Wenn ein menschlicher Agent dem Anruf beitreten muss, überträgt Retell diesen vollständigen Gesprächskontext zusammen mit einer KI-generierten Zusammenfassung, die die Situation erklärt.

Da der empfangende Agent die Interaktion sofort versteht, wird das Gespräch natürlich fortgesetzt, anstatt neu zu beginnen. In produktiven Anrufumgebungen ermöglicht diese Architektur den KI-Sprachagenten der Retell AI, die Eskalation von einem Fehlerpunkt in eine nahtlose Zusammenarbeit zwischen Automatisierung und menschlicher Expertise zu verwandeln.

Diese Architektur funktioniert, weil die Retell AI als sprachnative Infrastrukturschicht konzipiert ist und nicht als Chatbot-System, das an Telefonanrufe angepasst wurde. Gesprächszustand, Telefonie-Routing und Eskalationslogik arbeiten innerhalb derselben Laufzeitumgebung, sodass der Kontext auch dann bestehen bleibt, wenn die Kontrolle über das Gespräch wechselt. Für Engineering-Teams, die Sprachagenten in produktiven Anrufabläufen bereitstellen, ist genau diese architektonische Ausrichtung das, was eine zuverlässige Übergabe zwischen Mensch und KI in großem Maßstab ermöglicht.

Was eine zuverlässige Übergabe zwischen Mensch und KI in produktiven Sprachsystemen tatsächlich erfordert

Teams, die Sprachautomatisierung bewerten, gehen oft davon aus, dass die betreute Weiterleitung eine einfache Fähigkeit ist. In der Praxis funktioniert eine zuverlässige Übergabe zwischen Mensch und KI nur, wenn mehrere Infrastrukturschichten während eines laufenden Anrufs zusammenarbeiten.

In produktiven Umgebungen hängt die Eskalation von drei Systemkomponenten ab, die koordiniert zusammenwirken.

Verwaltung des Gesprächszustands

Ein Sprachagent muss ein strukturiertes Bewusstsein für die Interaktion aufrechterhalten, während der Anruf läuft. Dazu gehört die Verfolgung der Absicht des Anrufers, der Phase des Workflows, bereits gesammelter Informationen und der vom System versuchten Aktionen. Ohne einen persistenten Zustand wird die Eskalation zu einer blinden Weiterleitung.

Kontextaufbereitung für menschliche Agenten

Menschliche Agenten können während laufender Anrufe keine vollständigen Transkripte einsehen. Das System muss das Gespräch in ein strukturiertes Kontextpaket übersetzen, das erklärt, was der Anrufer benötigt und warum die Eskalation erfolgte. Dieser Schritt entscheidet darüber, ob der Agent vorbereitet oder verwirrt in die Interaktion einsteigt.

Routing-Koordination auf Telefonie-Ebene

Die Eskalation muss sich außerdem in die Routing-Schicht integrieren, die für die Zuweisung von Anrufen an Agenten verantwortlich ist. Das System muss sicherstellen, dass sowohl der Anruf als auch der zugehörige Kontext gleichzeitig den richtigen Agenten oder die richtige Abteilung erreichen.

Die Retell AI integriert diese Schichten innerhalb einer einzigen Sprachagenten-Laufzeitumgebung. Gesprächszustand, Eskalationslogik und Telefonie-Routing arbeiten während des Anrufs zusammen, sodass der Kontext auch dann bestehen bleibt, wenn der Sprecher wechselt.

Für Engineering-Teams, die Sprachautomatisierung in echten Anrufumgebungen bereitstellen, ist diese architektonische Ausrichtung das, was zuverlässige betreute Weiterleitungen in großem Maßstab ermöglicht.

Fazit

KI-Sprachagenten werden zunehmend leistungsfähiger, aber echte Anrufumgebungen erreichen immer wieder Momente, in denen Automatisierung allein nicht ausreicht. Die Systeme, die erfolgreich sind, sind nicht diejenigen, die Eskalation vermeiden – es sind diejenigen, die sie souverän bewältigen.

Wenn der Gesprächskontext den Übergang zu einem menschlichen Agenten übersteht, wird die Interaktion natürlich fortgesetzt. Wenn nicht, wird das gesamte Erlebnis zurückgesetzt.

Die Retell AI wurde mit Blick auf diesen Moment entwickelt. Durch die Bewahrung des Gesprächszustands, die Erstellung eines klaren Übergabekontexts und die Koordination der Eskalation mit dem Telefonie-Routing ermöglicht Retell, dass KI-Agenten und menschliche Teams innerhalb desselben Anrufflusses agieren.

Teams, die produktive Sprachautomatisierung erkunden, können mit der Sprachagenten-Plattform der Retell AI sehen, wie das in der Praxis funktioniert – konzipiert, um die Zusammenarbeit zwischen Mensch und KI in großem Maßstab nahtlos zu gestalten.

FAQ

1. Was ist eine betreute Weiterleitung in Sprach-KI-Systemen?

Eine betreute Weiterleitung ist eine Anrufeskalation, bei der der KI-Agent den Gesprächskontext an einen menschlichen Agenten übergibt, bevor der Anruf verbunden wird. Dieser Kontext umfasst in der Regel die Absicht des Anrufers, bereits gesammelte Informationen und den Grund, warum die KI die Anfrage nicht abschließen konnte. Ziel ist es, dem menschlichen Agenten die Fortsetzung der Interaktion zu ermöglichen, ohne den Anrufer zu bitten, Informationen zu wiederholen.

2. Warum versagen die meisten KI-Sprachassistenten während der Eskalation?

Viele konversationelle KI-Plattformen wurden ursprünglich für Chat-Umgebungen und nicht für Sprachinteraktionen in Echtzeit entwickelt. Infolgedessen behandeln sie die Eskalation oft als einfache Anrufweiterleitung. Wenn der Anruf einen menschlichen Agenten erreicht, geht der während des Gesprächs gesammelte Kontext verloren, was den Anrufer zwingt, Informationen zu wiederholen, und die Interaktion neu startet.

3. Wie bewahrt die Retell AI den Gesprächskontext während der Übergabe?

Die Retell AI hält während des gesamten Anrufs einen persistenten Gesprächszustand aufrecht. Wenn eine Eskalation eintritt, überträgt die Plattform sowohl den Anruf als auch den strukturierten Kontext der Interaktion an den empfangenden Agenten. Dazu gehören die Anfrage des Anrufers, bereits gesammelte Informationen und eine Zusammenfassung, die erklärt, warum menschliche Unterstützung erforderlich ist.

4. Wann sollte ein KI-Sprachagent an einen Menschen eskalieren?

Eine Eskalation sollte erfolgen, wenn die Anfrage des Anrufers über den unterstützten Workflow hinausgeht, wenn wiederholte Missverständnisse auftreten oder wenn die Interaktion menschliches Urteilsvermögen erfordert. Gut konzipierte Systeme erkennen diese Signale frühzeitig, sodass der Übergang erfolgt, bevor sich das Gespräch verschlechtert.

5. Welche Branchen profitieren am meisten von betreuten Weiterleitungen mit Sprach-KI?

Die Architektur der betreuten Weiterleitung ist besonders wertvoll in Branchen, in denen eingehende Anrufe häufig von Routineaufgaben zu komplexen Problemen wechseln. Gängige Beispiele sind der Kundensupport, die Terminplanung im Gesundheitswesen, Terminbuchungsdienste und die Qualifizierung eingehender Vertriebsanfragen.

6. Was sollten Teams bei der Auswahl einer Sprach-KI-Plattform bewerten?

Bei der Bewertung von Sprach-KI-Plattformen sollten sich Teams eher auf die Infrastrukturfähigkeiten als nur auf die Gesprächsqualität konzentrieren. Wichtige Faktoren sind die Verwaltung des Gesprächszustands, die Zuverlässigkeit der Eskalation, die Telefonie-Integration und die Art und Weise, wie die Plattform den Kontext bewahrt, wenn menschliche Agenten dem Anruf beitreten.

ROI-Rechner
Schätzen Sie Ihren ROI durch die Automatisierung von Anrufen

Sehen Sie, wie viel Ihr Unternehmen durch den Wechsel zu KI-gestützten Sprachagenten sparen könnte.

Fertig! 
Ihre Anfrage wurde an Ihre E-Mail-Adresse gesendet
Hoppla! Beim Absenden des Formulars ist ein Fehler aufgetreten.
   1
   8
20
Hoppla! Beim Absenden des Formulars ist ein Fehler aufgetreten.

ROI-Ergebnis

2,000

Total Human Agent Cost

$5,000
/month

AI Agent Cost

$3,000
/month

Estimated Savings

$2,000
/month
Live-Demo
Unsere Live-Demo ausprobieren

Eine Demo-Telefonnummer von Retell Clinic Office

Vielen Dank! Ihre Anfrage wurde erfolgreich übermittelt!
Ups! Beim Absenden des Formulars ist ein Fehler aufgetreten.

Read Other Blogs

Revolutionize your call operation with Retell