Ja, und die Architektur ist unkompliziert, sobald Sie aufhören, Copilot Studio damit zu beauftragen. Sie spiegeln autoritative Dokumente aus SharePoint, OneDrive oder Azure Blob in einen Vektorindex, der dem Agenten gehört, und lassen dann Microsoft Graph webhooks und Event-Grid-Benachrichtigungen inkrementelle Aktualisierungen antreiben. Änderungen in der Quelle propagieren innerhalb einstelliger Minuten zum Agenten. Kein erneutes Hochladen.
Die meisten Teams stoßen auf dieses Problem, nachdem sie bereits die offensichtlichen Wege ausprobiert haben. Der SharePoint-Connector von Copilot Studio wird bei Dateiänderungen immer noch nicht automatisch aktualisiert, eine von Microsoft im Juli 2025 bestätigte Einschränkung, die zum Zeitpunkt der Erstellung dieses Textes nicht behoben wurde. Azure AI Search kann SharePoint über einen Indexer erreichen, aber der Indexer kann nicht hinter Conditional Access sitzen, verfügt in der Preview nur über grundlegende ACL-Unterstützung und erfordert, dass Sie die Agentenschicht selbst aufbauen. Das in diesem Leitfaden beschriebene Muster verwendet Retell AI als Sprachschicht, weil ihre Wissensdatenbank-API authentifizierte Pushes von Ihrem eigenen Sync-Worker akzeptiert, was jede Einschränkung umgeht, die Microsofts First-Party-Weg auferlegt.
Einen Sprachagenten, der aus einem kuratierten Spiegel Ihres privaten Korpus antwortet, wobei Änderungen in fünf bis fünfzehn Minuten durchgängig propagieren, sowie einen täglichen Abgleichdurchlauf, der alles auffängt, was der Event-Stream verliert.
Am Ende wird Ihr Stack:
Bevor Sie beginnen, benötigen Sie:
Sites.Selected wird bevorzugt, Sites.Read.All ist der weiter gefasste Fallback)Weil die Tools für eine andere Aufgabe entwickelt wurden. Copilot Studio wurde entwickelt, um Inhalte für einen Menschen zusammenzufassen, der auf einen Bildschirm schaut, nicht um einen Sprachagenten zu speisen, der weniger als eine Sekunde Zeit hat, um eine gesprochene Antwort zu formulieren. Der SharePoint-Indexer von Azure AI Search wurde für die Unternehmenssuche entwickelt, bei der ein Aktualisierungsfenster von vier bis sechs Stunden in Ordnung ist. Keines der beiden Produkte wurde um die Annahme herum konzipiert, dass eine um 9 Uhr bearbeitete Abrechnungsrichtlinie die Antwort sein muss, die ein Anrufer um 9:08 Uhr hört.
Drei Einschränkungen unterscheiden Sprache von Text. Die erste ist das Latenzbudget. Ein Abrufaufruf muss während eines Live-Gesprächs in unter 100 Millisekunden zurückkommen, sodass der Index im selben Netzwerk wie der Agent liegen muss und die Chunks klein genug sein müssen, um inline eingebettet zu werden, ohne das Kontextfenster des LLM zu sprengen. Die zweite ist die Fehlertoleranz. Wenn ein Chatbot den falschen Link zurückgibt, klickt der Nutzer erneut. Wenn ein Sprachagent bei einem aufgezeichneten Compliance-Anruf eine außer Kraft gesetzte Richtlinie zitiert, haben Sie ein Problem mit angehängten Audit-Logs. Die dritte ist die Erwartung an die Aktualität. Vertriebsteams passen Preise dienstags an. Support-Teams veröffentlichen Richtlinienaktualisierungen nach einer Freitags-Incident-Review. Der Agent, der die Zahl der letzten Woche zitiert, ist schlimmer als gar kein Agent.
Deshalb trennt die Architektur die Single Source of Truth von der Abrufschicht. SharePoint bleibt kanonisch. Der Vektorindex ist ein abgeleitetes Artefakt, das die Sync-Pipeline aktuell hält. Fehlermodi werden beobachtbar statt still.
Wählen Sie danach aus, wo das Dokument verfasst wird, nicht danach, wo es am einfachsten anzubinden ist. Jede Quelle signalisiert etwas anderes darüber, wie der Inhalt gepflegt wird.
SharePoint-Dokumentbibliotheken sind die richtige primäre Quelle, wenn die Verantwortung kollaborativ ist und Inhalte durch Gremienprüfungen weiterentwickelt werden. Servicekataloge, Richtlinienhandbücher, interne Wikis und Sales-Playbooks liegen tendenziell hier, mit angehängtem Versionsverlauf, Kommentaren und Genehmigungsflüssen. Der Preis ist Metadaten-Wildwuchs: Eine typische Site enthält vier Versionen derselben Richtlinie, zwei außer Kraft gesetzte Entwürfe und den Screenshot-Ordner von irgendjemandem.
OneDrive ist selten die richtige primäre Quelle für einen Sprachagenten. Inhalte, die an das Konto einer Person gebunden sind, verlassen das Haus, wenn diese Person geht. Verwenden Sie OneDrive nur als Staging-Bereich, in dem einzelne Mitarbeiter Entwürfe verfassen, die nach der Prüfung in eine SharePoint-Bibliothek befördert werden.
Azure-Blob-Container sind die richtige Quelle, wenn Dokumente von vorgelagerten Systemen erzeugt werden. Generierte PDFs aus einer Abrechnungspipeline, von einem CLM-Tool abgelegte Verträge, Auszüge aus einem Exportjob und Transkripte aus einem Aufzeichnungssystem gehören alle in Blob. Das Volumen ist höher, die Aktualität ist schwerer vorzutäuschen, und die Dateibenennung folgt der Konvention, die das erzeugende System erzwingt, was Mirror-and-Sync einfacher macht als SharePoints freie Struktur.
Die meisten Enterprise-Teams synchronisieren beides. SharePoint speist die Richtlinien- und Produktseite, Blob speist die operative und maschinengenerierte Seite, und die Wissensdatenbank des Sprachagenten führt beides hinter einer einzigen Abruf-API zusammen.
Registrieren Sie eine Anwendung in Microsoft Entra ID, fordern Sie Anwendungsberechtigungen an und lassen Sie einen Tenant-Admin die Zustimmung erteilen.
Anwendungsberechtigungen laufen unter einem Service Principal. Der Worker läuft die ganze Nacht durch ohne angemeldeten Benutzer, und das Token ist über die Aufrufe hinweg konsistent. Delegierte Berechtigungen hingegen binden den Zugriff an ein echtes Benutzerkonto und erzwingen laut den Sicherheitsbibliotheken, die Microsoft mittlerweile verwendet, etwa alle 75 Minuten eine erneute Authentifizierung. Delegierte Berechtigungen können außerdem keine dokumentspezifischen ACLs bewahren, wie Microsofts eigene SharePoint-Indexer-Dokumentation anmerkt, was in dem Moment zum Problem wird, in dem die Compliance fragt, wer was hören darf.
Der Scope ist der Punkt, an dem die meisten Teams zu viel teilen. Die Erteilung von Sites.Read.All lässt die App jede Site im Tenant lesen. Das ist schnell beim Setup und in einem Audit nicht zu verteidigen. Die engere Alternative ist Sites.Selected, wobei ein Tenant-Admin die App nur gegen bestimmte Site-IDs vorab autorisiert. Der Worker sieht die Bibliotheken, die der Agent braucht, und nichts sonst. Verwenden Sie Sites.Selected vom ersten Tag an. Die nachträgliche Einführung eines Site-Level-Scopings erfordert eine erneute Zustimmung und meist eine Sicherheitsprüfung, die Sie nicht eingeplant hatten.
Für Azure Blob weisen Sie demselben Service Principal die Rolle Storage Blob Data Reader auf dem spezifischen Container zu. Container-Level-Scope schlägt Account-Level-Scope aus demselben Grund.
Kombinieren Sie zwei Microsoft-Graph-Primitiven. Webhooks sagen Ihnen, wann etwas passiert ist. Delta-Abfragen sagen Ihnen genau, was sich geändert hat.
Ein Webhook-Abonnement ist ein POST an /subscriptions mit einem Ressourcenpfad, der auf das Drive zeigt (zum Beispiel /sites/{site-id}/drive/root), einem changeType von updated und einer notificationUrl, die auf den HTTPS-Endpoint Ihres Workers gerichtet ist. Der Benachrichtigungstext ist bewusst dünn. Er trägt die Ressourcen-ID und den Änderungstyp, nicht mehr. Das ist beabsichtigt. Der Worker nutzt die Benachrichtigung als Signal, den Delta-Endpoint aufzurufen, wo die eigentliche Payload liegt.
Die Delta-Abfrage ist /sites/{site-id}/drive/root/delta. Beim ersten Durchlauf, ohne Token, erhalten Sie eine vollständige Enumeration plus einen opaken @odata.deltaLink. Speichern Sie diesen Link wortgetreu. Bei jedem folgenden Durchlauf spielen Sie ihn erneut ab, und Graph gibt nur die Elemente zurück, die seit dem letzten Aufruf hinzugefügt, geändert, umbenannt oder gelöscht wurden. Microsofts Scan-Guidance ist eindeutig: Webhooks plus Delta ist das empfohlene Muster für große Bibliotheken, weil reines Polling zu Throttling führt und reine Webhooks Daten verlieren, wenn der Endpoint langsam ist.
Zwei Weisheiten sind es wert, gekannt zu werden. Dasselbe Element kann bewusst mehr als einmal auf einer Delta-Seite erscheinen, weil Graph Ordnerhierarchien expandiert und gleichzeitige Änderungen zusammenführt. Wenn Duplikate auftauchen, nehmen Sie das letzte Vorkommen. Abonnements laufen ebenfalls ab. Erneuern Sie bei 75 % der maximalen Lebensdauer, nicht zum Deadline-Zeitpunkt. Ein Erneuerungsjob, der still fehlschlägt, ist der mit Abstand häufigste Grund, warum ein zuvor funktionierender Sync anfängt, auf veraltete Inhalte abzudriften, und Sie erfahren es, wenn sich ein Kunde beschwert.
Verwenden Sie Event Grid für Echtzeit-Benachrichtigungen und den Change Feed für den Batch-Abgleich. Sie lösen unterschiedliche Probleme, und die Antwort für die Produktion lautet, beides zu betreiben.
Event Grid pusht Ereignisse in dem Moment, in dem ein Blob erstellt, ersetzt oder gelöscht wird. Abonnieren Sie beim Speicherkonto, filtern Sie mit eventType auf Microsoft.Storage.BlobCreated und Microsoft.Storage.BlobDeleted und leiten Sie an Ihren Worker weiter. Für Azure Data Lake Storage Gen2 fügen Sie einen Filter auf den API-Aufruf FlushWithClose hinzu. Dies stellt sicher, dass das Ereignis erst ausgelöst wird, nachdem der Blob vollständig committet ist. Überspringen Sie dies, und Sie verarbeiten unvollständige Uploads, was Ingestion-Fehler erzeugt, die wie Dateibeschädigung aussehen, es aber nicht sind.
Der Change Feed ist das geordnete, dauerhafte Log hinter den Ereignissen. Laut Microsofts Dokumentation bietet er ein garantiertes Transaktionslog, das als Avro-Dateien in $blobchangefeed/log/ persistiert und innerhalb weniger Minuten nach jeder Änderung geschrieben wird. Event Grid ist Best-Effort und kann unter Last Benachrichtigungen verwerfen. Der Change Feed kann das nicht. Betreiben Sie einen täglichen Job, der den Change Feed durchläuft und gegen Ihr Wissensdatenbank-Manifest abgleicht, und Sie haben ein Sicherheitsnetz unter dem Echtzeit-Pfad.
Die Kombination ist entscheidend. Event Grid allein ist schnell, aber verlustbehaftet. Der Change Feed allein ist zuverlässig, aber langsam. Zusammen geben sie Ihnen Aktualität im Minutenbereich auf dem Happy Path und volle Konsistenz bis zum Morgen auf dem Unhappy Path.
Der Worker lädt die Datei herunter, normalisiert sie und pusht sie an die Plattform-API. Drei Operationen: erstellen, aktualisieren, löschen. Umbenennen fällt in Löschen-plus-Erstellen zusammen.
Die Retell AI Wissensdatenbank akzeptiert eine lange Liste von Dokumentformaten, darunter PDF, DOCX, PPTX, XLSX, CSV, TSV, TXT, MD, HTML, RTF, ODT, EPUB, sowie Nachrichtenformate und mehrere Bildtypen. Die wichtigen Einschränkungen: 50MB pro Datei, 25 Dateien pro Datenbank und 1.000 Zeilen mal 50 Spalten für Tabellenkalkulationen. Markdown wird am saubersten aufgenommen, wenn Sie das Quellformat kontrollieren, weshalb Teams oft einen Normalisierungsschritt betreiben, der verfasste Word-Dokumente vor dem Push in Markdown konvertiert.
Wenn die Dateizahl über 25 wächst, teilen Sie die Datenbanken nach Domäne statt nach Abteilung auf. Ein Abrechnungsagent, der mit "billing-policies-en", "service-catalog-2026" und "exception-cases" verknüpft ist, ruft über alle drei sauber ab, weil die Abrufähnlichkeit pro Chunk berechnet wird, nicht pro Datenbank. Eine Aufteilung nach Abteilung hingegen schafft die falschen Grenzen. Dieselbe Anruferfrage überspannt oft zwei Abteilungen, und der Agent ruft nur aus einer davon ab.
Für die operative Seite ist Idempotenz das, was Sie rettet, wenn dieselbe Benachrichtigung zweimal ankommt. Hashen Sie den Inhalt jeder Datei und verwenden Sie den Hash als Dokumentkennung. Eine doppelte Benachrichtigung für eine unveränderte Datei erzeugt einen No-op statt eines doppelten Indexeintrags.
Ein reiner Textextraktor verliert in einer echten PowerPoint oder einer Finanz-Arbeitsmappe still 30 bis 40 Prozent der Bedeutung. Der Agent zitiert dann selbstbewusst die überlebenden 60 Prozent, einschließlich der Teile, die ohne die Tabelle, aus der sie stammen, keinen Sinn mehr ergeben.
PowerPoints kodieren Informationen im Folienlayout, in Tabellenzellen, in bildbasierten Callouts und in Sprechernotizen. Excel kodiert Bedeutung in Spaltenüberschriften, die verbundene Zellen überspannen, in Formeln, die andere Tabs referenzieren, und in der Tab-Reihenfolge. Naive Textextraktion gibt eine flache Zeichenkette von Wörtern zurück, wobei die Struktur entfernt ist. Zwei Wege überstehen die Produktion.
Der erste ist layoutbewusstes Parsing. Tools wie Unstructured, Azure Document Intelligence oder LlamaParse bewahren Tabellenzellen und Folienstruktur als Markdown. Sie sind pro Dokument günstiger und in der Ausgabe vorhersehbar. Der Nachteil ist, dass sie Tabellen gut, Diagramme aber schlecht handhaben.
Der zweite, der seit Mitte 2025 an Zugkraft gewonnen hat, ist die bildbasierte Extraktion. Rendern Sie jede Folie oder jedes Sheet in ein Bild und geben Sie es durch ein Vision-fähiges LLM, das Markdown zurückgibt. Die Ausgabe stellt Tabellen, Diagramme und visuelle Callouts wieder her, die Textextraktoren verpassen. Die Kosten sind pro Dokument höher und langsamer, was dies zum richtigen Weg für die Dokumente macht, die tatsächlich zählen, und zum falschen Weg für die Massenaufnahme von allem in einer SharePoint-Site.
Die Entscheidungsregel, die sich bewährt: Leiten Sie Richtliniendokumente durch den günstigen layoutbewussten Weg, leiten Sie eine kleine Menge hochwertiger visueller Dokumente (One-Pager, Foliensätze, auf die sich Führungskräfte beziehen, die Preislisten, die Ihr Vertriebsteam tatsächlich nutzt) durch den bildbasierten Weg. Versuchen Sie nicht, einen Ansatz für alles zu verwenden.
Rekursives Zeichensplitting bei 512 Tokens mit 10 bis 20 Prozent Überlappung, drei abgerufene Chunks bei Standard-Ähnlichkeit. Passen Sie von dort aus auf Basis Ihrer eigenen Anrufdaten an.
Das ist nicht die populäre Antwort. Die populäre Antwort ist semantisches Chunking, das intelligenter klingt und im Benchmark schlechter abschneidet. Der Anfang 2026 veröffentlichte Vecta-Benchmark stellte rekursives 512-Token-Splitting bei 69 Prozent Abrufgenauigkeit und semantisches Chunking bei 54 Prozent auf demselben 50-Dokumente-Korpus fest. Die Forschung von NVIDIA landet am selben Ort: Faktoid-Abfragen (die Art, die ein Sprachagent erhält) schneiden bei 256 bis 512 Tokens am besten ab, mit 10 bis 20 Prozent Überlappung, um den Satzkontext über Grenzen hinweg zu bewahren.
Die praktische Implikation für den Sync: Das Ändern der Chunk-Größe oder des Embedding-Modells macht jeden bestehenden Chunk in der Datenbank ungültig. Wenn der Abruf nach einem Tuning-Durchlauf plötzlich schlechter abschneidet, patchen Sie nicht inkrementell. Löschen Sie die Datenbank, nehmen Sie die Quelle erneut auf und akzeptieren Sie die Neuverarbeitungskosten von wenigen Stunden. Die Klarheit, die Sie bei jeder zukünftigen Antwort erhalten, ist die Wiederholung wert.
Das Tuning des Abrufschwellenwerts geschieht, nachdem Sie Anrufdaten haben, nicht davor. Ziehen Sie 50 bis 100 Anrufe aus der Anrufnachbearbeitung, taggen Sie die Fehler mit falschen Chunks und passen Sie entweder das Chunking der problematischen Quelle oder den Ähnlichkeitsschwellenwert an. Die meisten Teams übertunen zunächst. Die Standardeinstellungen sind für 80 Prozent der Anwendungsfälle korrekt.
Bauen Sie einen Closed-Loop-Test, der von der Änderung bis zur gesprochenen Antwort mit einer eindeutigen testbaren Phrase zurückverfolgt. Das ist die nützlichste Fünf-Minuten-Prüfung in der gesamten Pipeline.
Wählen Sie ein Dokument und bearbeiten Sie darin einen eindeutigen numerischen Wert. "Premium-Tier-Rabatt: 12,5 %" wird zu "Premium-Tier-Rabatt: 14,0 %". In SharePoint speichern. Innerhalb von fünf bis fünfzehn Minuten (Graph-Benachrichtigung, Delta-Verarbeitung, Embedding) sollte die Änderung im Index live sein. Platzieren Sie einen Testanruf, der die Frage stellt. Wenn der Agent 14,0 % sagt, funktioniert die Schleife.
Wenn nicht, isoliert sich der Fehler sauber. Hat der Worker den Webhook empfangen? Prüfen Sie Ihre Endpoint-Logs. Hat die Delta-Abfrage die Datei zurückgegeben? Prüfen Sie die Worker-Logs. Ist der Upload gelungen? Prüfen Sie die API-Antwort. Hat es der Chunk in den Abruf geschafft? Prüfen Sie das Abruf-Log des Anrufs in der Anrufnachbearbeitung. Jede Schicht beantwortet eine Ja/Nein-Frage, und Sie finden die kaputte Schicht in unter zehn Minuten.
Führen Sie diese Schleife nach jeder bedeutsamen Pipeline-Änderung aus. Neue Chunking-Strategie, neues Embedding-Modell, neue Quelle, neue Sync-Worker-Version. Wenn die Schleife schließt, ist die Änderung sicher auslieferbar. Wenn nicht, haben Sie eine präzise Reproduktion des Bugs.
Drei Schichten, in dieser Reihenfolge angewendet. An der Quelle beschneiden. Am Prompt einschränken. Am Anruf beobachten.
Das Beschneiden an der Quelle ist die Schicht, die die meisten Teams überspringen und später dafür bezahlen. Wenn eine Richtlinie außer Kraft gesetzt wird, verschieben Sie die Datei aus dem synchronisierten Ordner. Das sauberste Muster ist eine Aufteilung der Verzeichnisse synced/ und archive/ innerhalb derselben SharePoint-Bibliothek, wobei der Worker nur synced/ beobachtet. Zwei indexierte Versionen derselben Richtlinie sind ein Rezept für selbstbewusste Widersprüche, und Sie können sich nicht aus widersprüchlichen Quelldokumenten herausdebuggen.
Das Einschränken am Prompt ist Schicht zwei. Weisen Sie den Agenten an, nur aus dem abgerufenen Wissensdatenbank-Kontext zu antworten und zu eskalieren, wenn keiner verfügbar ist. Öffentliche Benchmarks zeigen, dass fundiertes RAG die Halluzinationsraten gegenüber ungefundeten LLMs um 26 bis 43 Prozent senkt. Der Vorteil hält nur, wenn der Abruf das richtige Dokument zutage fördert. Eine Antwort "Keine Antwort gefunden, ich stelle Sie durch" ist fast immer besser als eine selbstbewusst falsche, und eine Eskalationsregel, die bei einem Abruf mit niedriger Ähnlichkeit auslöst, ist eine der hebelstärksten Einstellungen im Agenten.
Das Beobachten am Anruf ist Schicht drei und dort, wo die Schleife schließt. Taggen Sie jeden Fehltreffer mit einer Kategorie: fehlende Quelle, falscher Chunk abgerufen, veralteter Inhalt, Modell-Fehlinterpretation. Jede Kategorie hat einen anderen Fix. Fehlende Quellen gehen in den nächsten Ingestion-Durchlauf. Falsche Chunks bedeuten meist, dass zwei Dokumente ähnliche Themen mit unterschiedlichem Vokabular behandeln, was sich mit Metadaten-Tags oder durch das Aufteilen der Quelle beheben lässt. Veralteter Inhalt verfolgt zurück zu einer Webhook-Lücke, die der tägliche Abgleich hätte auffangen sollen und nicht auffing, was ein Bug in Ihrem Abgleichjob ist.
Für ein Team, das 5.000 Anrufe pro Monat mit je drei Minuten handhabt, ist die Wissensdatenbank-Nutzung um eine Größenordnung der kleinste Posten.
Retell AI berechnet $0,07 pro Minute für die Basis-Anrufkosten, mit einer Wissensdatenbank-Nutzung von $0,005 pro Minute obendrauf. Jeder Workspace enthält 10 kostenlose Wissensdatenbanken. Zusätzliche Datenbanken kosten $8 pro Monat. Für 15.000 Minuten monatlicher Anrufzeit fügt die Wissensdatenbank-Nutzung $75 hinzu. Die Basis-Anrufkosten betragen $1.050. Vergleichen Sie beides mit dem SDR- oder Empfangsgehalt, das der Agent aufwiegt, und die Rechnung wird offensichtlich. Preise sind konsistent, egal ob Sie eine Datenbank oder sieben verwenden, und es gibt keine Plattformgebühr obendrauf.
Die versteckten Kosten liegen auf der Microsoft-Seite, und sie sind meist klein, aber leicht falsch zu konfigurieren. Microsoft Graph berechnet pro Aufruf. Azure Event Grid berechnet pro Million Operationen. Beide sind bei typischem Sync-Volumen Centbeträge. Der Weg, dies in eine echte Rechnung zu verwandeln, führt über das Pollen von SharePoint alle 30 Sekunden statt über das Abonnieren von Webhooks. Ein solcher Bug hat bei mindestens einem Team, das ich gesehen habe, die Azure-Verbrauchskosten um den Faktor fünfzig hochgetrieben. Webhook plus Delta hält die Rechnung flach, unabhängig davon, wie oft sich die Quelle ändert.
Diese treten über Deployments hinweg oft genug auf, dass sie eine Checkliste verdienen.
Ablauf des Webhook-Abonnements. Abonnements erneuern sich nicht selbst. Fügen Sie den Ablauf zu Ihrem Alerting hinzu und erneuern Sie bei 75 Prozent der maximalen Lebensdauer. Stiller Ablauf ist die häufigste Drift-Ursache.
Handhabung von Löschungen. Die meisten Teams liefern einen Sync aus, der erstellte und aktualisierte Dateien handhabt und entfernte vergisst. Der Agent zitiert dann eine Richtlinie, die vor drei Monaten außer Kraft gesetzt wurde. Verdrahten Sie den Änderungstyp deleted als erstklassigen Fall, nicht als Randfall.
Tenant-weiter Lesescope. Die Erteilung von Sites.Read.All beim Setup ist schnell. Wenn ein Auditor sechs Monate später fragt, welche Sites der Sprach-Service-Principal sehen kann, ist "alle" die falsche Antwort. Verwenden Sie Sites.Selected von Anfang an.
Dokumente über der 50MB-Obergrenze. Lange Handbücher scheitern still beim Upload, wenn sie das Limit pro Datei überschreiten. Verarbeiten Sie übergroße Dokumente vor, indem Sie sie an logischen Grenzen aufteilen (Kapitel, Abschnitt, Produktlinie) und jedes Stück als eigenes Dokument hochladen. Behalten Sie Parent-Child-Metadaten bei, damit der Abruf sie bei Bedarf wieder zusammenfügen kann.
Drift zwischen Staging- und Produktions-Wissensdatenbanken. Teams bauen eine Sync-Pipeline gegen eine Staging-Datenbank, kopieren die Agenten-Konfiguration in die Produktion und vergessen, dass der Produktionsagent immer noch auf die manuell hochgeladenen Dateien des letzten Quartals zeigt. Machen Sie die Wissensdatenbank-ID in Ihrer Deployment-Konfiguration explizit und verifizieren Sie sie nach jedem Release.
Ja. Die Architektur besteht aus Service-Principal-Authentifizierung über Microsoft Entra ID, Dateien, die über einen authentifizierten Graph-Kanal abgerufen werden, und Uploads, die über HTTPS an die Wissensdatenbank-API gepusht werden. Quelldokumente bleiben in SharePoint mit ihren bestehenden ACLs. Die Wissensdatenbank hält eine indexierte Kopie, die nur für den Abruf während Anrufen verwendet wird, und Sie können den Service Principal auf eine einzelne Site beschränken, falls die Compliance es erfordert.
Fünf bis fünfzehn Minuten durchgängig auf dem Happy Path. Die Aufschlüsselung: Graph-Webhook-Zustellung innerhalb weniger Minuten, Delta-Abfrage und Download in unter einer Minute, Parsing und Embedding in ein bis drei Minuten je nach Dokumentgröße. Einmal indexiert, fügt der Abruf während des Anrufs selbst unter 100 Millisekunden hinzu, sodass Anrufer keine Pause wahrnehmen.
Ein täglicher Abgleichjob spielt die Delta-Abfrage erneut ab und vergleicht die Ergebnisse mit dem Wissensdatenbank-Manifest, wodurch alles aufgefangen wird, was Event Grid oder Graph verpasst haben. Die Kombination aus Echtzeit-Webhooks und einem täglichen Delta-Durchlauf ist das Standardmuster, das in Microsofts eigenen Engineering-Texten empfohlen wird, gerade weil Benachrichtigungen Best-Effort sind.
Ja. Dasselbe Worker-Muster gilt für Google Drive (über die Drive Activity API), Amazon S3 (über S3 Event Notifications), Confluence, Notion und jede Quelle, die Änderungsereignisse ausgibt. Die Wissensdatenbank-API ist quellenunabhängig. Das einzige, was sich ändert, ist der Auth- und Event-Listening-Code.
Der SharePoint-Connector von Copilot Studio wird bei Dateiänderungen nicht automatisch aktualisiert, eine von Microsoft Mitte 2025 bestätigte Einschränkung, für die zum Zeitpunkt der Erstellung dieses Textes kein Fix ausgeliefert wurde. Workarounds beinhalten Power-Automate-Flows, die manuelle Aktualisierungen auslösen. Über das Sync-Problem hinaus ist Copilot Studio für Chat-Oberflächen gebaut und erzeugt keine Sprachlatenz im Subsekundenbereich. Für Telefonagenten ist die Architektur in diesem Leitfaden der Weg.
Retell AI wird mit SOC 2 Type II, HIPAA mit Self-Service-BAA und DSGVO ausgeliefert, plus konfigurierbarer Datenaufbewahrung und PII-Schwärzung. Für Gesundheitswesen-Workloads besteht das Standardmuster darin, die BAA zu gaten, bevor PHI den Index berührt. Die Compliance-Haltung gegenüber Ihrem spezifischen regulatorischen Regime müssen Sie selbst validieren. Die Zertifizierungen auf Infrastrukturebene decken die Plattform ab, nicht Ihre Inhaltsklassifizierungsrichtlinie.
Ja. Ein Agent kann mehrere verknüpfte Wissensdatenbanken haben, und jede Datenbank kann aus einer anderen Quell-Pipeline schöpfen. Ein gängiges Muster ist eine Datenbank pro logischer Domäne (Abrechnung, Support, Produktspezifikationen) mit sauber getrennten Quellen. Conversation-Flow-Nodes können auch eine andere Datenbank an einen bestimmten Node binden, wenn Vertriebs- und Support-Pfade unterschiedlichen Kontext benötigen.
Ein Ingenieur, der mit OAuth und Webhooks für die Sync-Schicht vertraut ist, ein Ops-Verantwortlicher für den Agentenaufbau und das Prompt-Tuning und ein Content-Verantwortlicher, der entscheidet, was in den synchronisierten Ordner gehört. Die in der Praxis funktionierende Aufteilung: Die IT besitzt den Worker und die Auth; Ops besitzt den Agenten; das Content-Team besitzt, was im Scope ist. Die Architektur unterstützt ein Ein-Personen-Setup für den Proof of Concept und skaliert ohne Neuarchitektur.
Der SharePoint-Indexer von Azure AI Search handhabt die Ingestion gut, hat aber harte Limits, die es wert sind, gekannt zu werden. Er unterstützt keine Tenants mit aktiviertem Conditional Access. Die ACL-Bewahrung befindet sich in der Public Preview, nicht in GA. Die Aktualisierungslatenz läuft in Stunden, nicht in Minuten. Und Sie müssen die Sprachagentenschicht trotzdem obendrauf bauen. Für die reine Unternehmenssuche ist AI Search in Ordnung. Für Sprache ist das Sync-into-Retell-AI-Muster operativ einfacher und schneller bereitzustellen.
Rekursives 512-Token-Splitting mit 10 bis 20 Prozent Überlappung. Dies ist der benchmark-validierte Standard über die Evaluierungen von 2026 hinweg und übertrifft semantisches Chunking auf realen Dokumentenkorpora um etwa 15 Punkte. Drei abgerufene Chunks bei Standard-Ähnlichkeit. Tunen Sie erst, nachdem Sie 50 bis 100 echte Anruftranskripte haben, um die Änderung zu informieren.
Die Sync-Pipeline ist die unglamouröse Hälfte der Sprach-KI, und sie ist auch die Hälfte, die entscheidet, ob das Deployment ausgeliefert wird oder stockt. Ein Pilotprojekt, das "mit Demo-Daten funktioniert" und in dem Moment umkippt, in dem sich eine Richtlinie ändert, ist der signatur-typische Fehlermodus in diesem Bereich, und die obige Architektur ist der Fix.
Sobald die Wissensdatenbank solide ist, expandiert derselbe Agent auf denselben Daten in angrenzende Workflows. KI-Kundensupport für eingehende Fragen, Lead-Qualifizierung für ausgehende, eine Empfangskraft, die zu beidem weiterleitet. Der Korpus, den Sie für einen kuratiert haben, wird zur Single Source of Truth für alle.
Starten Sie kostenlos mit $10 Guthaben auf retellai.com.
Sehen Sie, wie viel Ihr Unternehmen durch den Wechsel zu KI-gestützten Sprachagenten sparen könnte.
Total Human Agent Cost
AI Agent Cost
Estimated Savings
Eine Demo-Telefonnummer von Retell Clinic Office

Start building smarter conversations today.


.avif)
.avif)