Structureer hem als recursieve Markdown-chunks van 512 tokens, getagd met metadata voor product, regio en doelgroep, opgehaald bij een similariteitsdrempel van 0,65+ met een expliciete weigerinstructie. Dit is het vierlagenpatroon (curatie, chunking, metadata-scoping, retrieval die standaard weigert) dat productieklare stemagenten op platformen zoals Retell AI gebruiken om de faalmodus van de verzonnen stap te voorkomen.
De rest van deze gids licht elke laag toe met de exacte configuratiewaarden, een referentiestructuur gemodelleerd op enterprise-supportbibliotheken zoals die van Lenovo, en het testprotocol dat hallucinaties opspoort voordat ze een beller bereiken.
Een retrieval-architectuur die elke reactie van de agent baseert op je geverifieerde content, het model blokkeert om stappen te verzinnen en binnen het latency-budget blijft dat nodig is voor natuurlijke telefoongesprekken.
Aan het eind van deze tutorial zal je kennisbank:
Archiveer elk document dat verouderd of tegenstrijdig is, of niet de enige bron van waarheid voor zijn onderwerp is, voordat je ook maar één pagina indexeert. De grootste bron van hallucinaties van stemagenten is niet het model. Het is tegenstrijdige of verouderde content in het bronmateriaal.
Als twee pagina's het oneens zijn over je terugbetalingstermijn, heeft de retriever geen manier om de juiste te kiezen, en de LLM leest zelfverzekerd de chunk voor die de similariteitsscore wint. Haal elk document, elke FAQ en elk helpartikel op dat je van plan bent te indexeren. Controleer voor elk drie dingen: is het actueel per dit kwartaal, is het de enige bron van waarheid voor zijn onderwerp, en komt het overeen met wat je senior supportmedewerkers daadwerkelijk zeggen tijdens gesprekken. Als een document niet gebruikt zou moeten worden om klantvragen te beantwoorden, hoort het helemaal niet in je kennisbank thuis. ElevenLabs
Je zou nu een gecureerde set documenten moeten hebben die je zonder problemen woordelijk naar een klant zou sturen.
Converteer alles naar gestructureerde Markdown met één H1 per document, een beschrijvende H2 per oplosbare gebruikersvraag, en korte alinea's met expliciete onderwerpen. Stemagenten halen tekst-chunks op, geen gerenderde webpagina's. Markdown is het formaat dat de chunking-pijplijn met de meeste semantische structuur intact overleeft.
De eigen documentatie van Retell raadt Markdown boven .txt aan omdat goed gestructureerde koppen de retriever schone grenzen geven om op te splitsen. Vervang elke "klik hier" of "zoals hierboven beschreven" door de concrete verwijzing, want de chunk met "hierboven" kan worden opgehaald zonder de chunk waar hij naar verwijst. Elke chunk wordt afzonderlijk gelezen, dus elke chunk moet op zichzelf logisch zijn.
Je zou nu een map met Markdown-bestanden moeten hebben waarin elk bestand één productgebied behandelt en elke H2 één oplosbare gebruikersvraag behandelt.
Gebruik recursieve chunking bij 512 tokens met 10-15% overlap, waarbij je eerst op Markdown-koppen splitst, dan op alinea's, dan op zinnen. Dit is de benchmark-gevalideerde standaard voor algemene RAG-content, en het houdt specifiek voor voice-supportmateriaal goed stand.
Een goed afgestemde recursieve splitter van 512 tokens met 15% overlap en metadata-verrijking presteert beter dan een dure semantische chunking-aanpak op de meeste real-world documentsets. Lange chunks vullen het LLM-contextvenster met ruis. Korte chunks fragmenteren instructies over meerdere retrievals en zorgen ervoor dat de agent stappen overslaat midden in een uitleg. De harde regel: splits nooit een genummerde procedure over twee chunks. Als "Stap 3" in chunk A staat en "Stap 4" in chunk B, kan de retriever de een teruggeven zonder de ander en slaat je agent een actie over. Substack
Je zou nu chunks moeten hebben waarbij elke eenheid ofwel een complete procedure bevat, ofwel contextuele tekst die logisch is zonder zijn buren.
Tag elke chunk met minimaal vijf velden: product, version, region, audience en last_verified_date. Dit voorkomt dat een beller uit Texas het retourbeleid van CaliforniΓ« hoort en dat een ThinkPad-vraag ThinkCentre-antwoorden ophaalt.
Als één agent KB-content voor meerdere staten of locaties ziet, kan retrieval de chunk van de verkeerde staat ophalen (bijv. Californisch beleid voor een beller uit Texas) tenzij scoping en metadata zorgvuldig zijn ontworpen. Hetzelfde probleem geldt voor productlijnen, softwareversies, klantniveaus en supportkanalen. Tijdens runtime geeft je agent de relevante filters mee met de query, zodat de vector-zoekopdracht alleen chunks in overweging neemt die overeenkomen met de context van de beller. In Retell kun je deze als dynamische variabelen meegeven die eerder in het gesprek zijn verzameld. Optimize Smart
Je zou nu een metadata-schema moeten hebben waarbij elke afzonderlijke chunk uniek gescoped kan worden naar één bellercontext.
Stel de similariteitsdrempel in op 0,65 of hoger en beperk retrieval tot 3-5 chunks. Een retrieval-systeem dat altijd iets teruggeeft, is een vermomde hallucinatiemachine.
Wanneer een beller vraagt naar een functie die je niet documenteert, brengt de retriever alsnog de dichtstbijzijnde semantische match naar boven. De LLM ontvangt die chunk en weeft hem vloeiend in een verkeerd antwoord. In de kennisbank-instellingen van Retell bepalen twee parameters dit gedrag. De parameter "Chunks to retrieve" bepaalt hoeveel resultaten in de LLM worden ingevoerd (standaard 3, aanbevolen maximaal 5 voor voice). De "Similarity Threshold" bepaalt de minimale cosinus-similariteit waarbij een chunk als relevant wordt beschouwd (standaard 0,6). Voor software-support use cases waarbij verkeerde informatie erger is dan geen informatie, verhoog de drempel naar 0,7.
Je zou nu moeten zien dat je retrieval-systeem minder, hoogwaardigere matches teruggeeft en marginale matches afwijst.
Voeg deze exacte instructie toe aan de agent-prompt: "Antwoord alleen met de informatie in ## Related Knowledge Base Contexts. Als die sectie ontbreekt of geen relevante informatie bevat, zeg dan dat er geen gerelateerde informatie beschikbaar is en bied aan om het gesprek door te verbinden." Deze ene instructie is de meest effectieve anti-hallucinatiecontrole in elke stemagent.
Zonder die instructie grijpt de LLM naar zijn trainingsdata wanneer retrieval leeg terugkomt. Dit is de faalmodus achter bijna elke publieke chatbot-ramp, inclusief de Air Canada-rouwtariefzaak waarin de luchtvaartmaatschappij juridisch aansprakelijk werd gehouden. Het weigerpatroon draait de faalmodus om van "zelfverzekerd verkeerd antwoord" naar "eerlijk laat-me-een-mens-erbij-halen", wat precies is wat bellers die je software gebruiken daadwerkelijk willen wanneer het systeem een randgeval tegenkomt.
Je zou nu moeten zien dat je agent "ik heb dat niet gedocumenteerd; ik verbind je door" zegt bij vragen buiten de scope, in plaats van stappen te verzinnen.
Schakel auto-refresh in op URL-bronnen zodat Retell elke 24 uur opnieuw ophaalt, versioneer je Markdown-bestanden in Git, en voer elk kwartaal een review uit van elk bestand met een last_verified_date ouder dan 90 dagen. Verouderde kennis is de stille partner van hallucinatie.
Als de kennisbank verouderd is, haalt RAG het verkeerde antwoord gewoon sneller op. De oplossing is het automatiseren van actualiteit in plaats van te vertrouwen op iemand die eraan denkt bestanden opnieuw te uploaden wanneer productdocumentatie verandert. Combineer auto-refresh met auto-crawling voor subpaden van het helpcentrum, zodat nieuwe artikelen automatisch worden geΓ―ndexeerd zonder handmatige tussenkomst. CX Today
Je zou nu een kennisbank moeten hebben die zichzelf bijwerkt wanneer je onderliggende content wordt bijgewerkt, zonder mens in de lus.
Voer je 50 echte bellervragen door het retrieval-systeem en inspecteer wat er terugkomt voordat er enige LLM-generatie plaatsvindt. Drie dingen zijn belangrijk voor elke query: staat de juiste chunk in de top 3, ligt de similariteitsscore boven je drempel, en zou een mens die alleen de opgehaalde chunks leest de vraag kunnen beantwoorden.
Voor elke vraag waarbij retrieval faalt, ligt de oplossing bijna altijd bij de bron. Ofwel ontbreekt de relevante content volledig, ofwel heeft de chunking een procedure over grenzen gesplitst, ofwel filtert de metadata hem eruit. Weersta de neiging om retrieval-fouten op te lossen door instructies toe te voegen aan de agent-prompt. Prompt-patches zijn hoe kennisbanken afdrijven naar een onhoudbare puinhoop. Streef naar 90%+ retrieval-nauwkeurigheid op de testset voordat je uitrolt naar echte gesprekken.
Je zou nu een gemeten retrieval-nauwkeurigheidscijfer moeten hebben voor je belangrijkste bellervragen en een lijst met brondocument-fixes voor de vragen die faalden.
Gebruik conversation flow met kennisbanken op node-niveau voor elke stemagent waarbij de intentie van de beller opsplitst in aparte workflows, met name software-support, zorgplanning en multi-product-omgevingen. Een platte kennisbank onder één enkele prompt is de losste mogelijke architectuur.
Specifiek voor software-support is het hoogwaardigste patroon conversation flow waarbij elke node alleen ophaalt uit het stuk documentatie dat relevant is voor dat deel van het gesprek. Een typische software-support-flow heeft nodes voor triage, accountopzoeking, probleemoplossing, escalatie en bevestiging na afhandeling. De probleemoplossing-node laadt de probleemoplossing-KB. De accountopzoeking-node laadt helemaal geen KB, omdat die een API zou moeten aanroepen. Deze structuur is betrouwbaarder te onderhouden dan één gigantische prompt met één gigantische KB. Combineer het met ingebouwde analyse na het gesprek zodat je kunt zien welke nodes retrieval activeren en welke queries onder de drempel terugkomen.
Je zou nu een implementatie moeten hebben waarbij de retrieval-scope zich vernauwt naarmate het gesprek versmalt, in plaats van dat elke beurt elk document doorzoekt.
Verdeel de kennisbank in niveaus op doelgroep en scope retrieval naar het niveau van de beller. Dit is het structurele patroon dat de enterprise-supportbibliotheek van Lenovo gebruikt om te voorkomen dat klasmanagement-content voor docenten botst met technische engineering-content.
Lenovo stelde drie niveaus van artikelen vast β algemene onderwerpen en productinformatie, docentspecifieke onderwerpen, en technische onderwerpen en problemen, met gerichte artikelen, geΓ«limineerde redundanties en gestandaardiseerde naamgevingsconventies over alle drie de niveaus. Pas hetzelfde patroon toe op een voice-AI-kennisbank: Contiem
Niveau 1: Algemeen product en prijzen. Publiek toegankelijke feiten waar elke beller om zou kunnen vragen. Getagd audience: all. Indexeer alles.
Niveau 2: Eindgebruiker-instructies. Stapsgewijze procedures voor de standaardbeller. Getagd audience: end_user, gescoped op product en region. Dit niveau draagt het grootste deel van het retrieval-verkeer.
Niveau 3: Technisch en admin. Configuratie, integraties en randgevallen. Getagd audience: admin. Wordt alleen opgehaald wanneer de beller eerder in het gesprek als beheerder is geΓ―dentificeerd.
Interne runbooks, escalatiematrices en engineering-notities gaan in een volledig aparte kennisbank, nooit toegankelijk voor de klantgerichte agent. De niveau-indeling voorkomt dat een probleemoplossingsgesprek van een eindgebruiker per ongeluk een interne escalatieprocedure naar boven brengt.
Nee. De kennisbank is bedoeld om ondersteunende informatie aan te leveren, niet het gedrag van de agent. Als je merkt dat je een Markdown-bestand uploadt met de titel "Hoe de agent zich moet gedragen wanneer X gebeurt", hoort die content in de prompt of in een conversation flow-node. Ze mengen verwatert beide: de retriever rangschikt gedragsinstructies tegen feitelijke queries en haalt ze op de verkeerde momenten op.
Begin met het gebruikersdoel, niet de functienaam. "Twee-factor-authenticatie configureren" wordt "Twee-factor-login inschakelen". De retriever matcht tegen de gesproken bewoording van de beller, en natuurlijke-taalvragen matchen veel beter met natuurlijke-taalkoppen dan met productterminologie.
Elke chunk wordt afzonderlijk opgehaald. Gebruik volledige namen in plaats van voornaamwoorden, volledige productnamen in plaats van "het platform", en herhaal elke voorwaardelijke context in elke stap in plaats van drie alinea's later "als je de admin-console gebruikt, dan..." te zeggen. Deze ene regel elimineert een verrassend deel van de hallucinaties omdat het de dubbelzinnigheid wegneemt die de LLM anders probeert op te lossen door te gokken.
Leg de opgehaalde chunks, similariteitsscores en metadata-filters op elk gesprek vast, naast het transcript. Alleen de uiteindelijke reactie van de agent loggen maakt het debuggen van hallucinaties bijna onmogelijk: je ziet het verkeerde antwoord, maar niet of de retriever de verkeerde chunk teruggaf of dat de juiste chunk verkeerd werd gegenereerd. De meeste "hallucinatie"-tickets blijken retrieval-rangschikkingsproblemen te zijn, die bij de bron worden opgelost.
De chunking-pijplijn kan de ruimtelijke relaties die tabellen leesbaar maken niet behouden, dus een tabelcel wordt vaak opgehaald zonder de kolomkop. Herschrijf kritieke tabellen als tekst met expliciete zinnen. "Het Pro-plan ondersteunt 50 gebruikers en bevat API-toegang" verslaat een tabelcel die de retriever losmaakt van de kolomkop.
Een kennisbank met 4.000 chunks waarvan er 50 relevant zijn voor een bepaalde beller is slechter dan een met 400 chunks waarvan er 50 relevant zijn, omdat de retriever 10x meer concurrerende matches heeft om hem in de war te brengen. Bouw in plaats daarvan smalle kennisbanken per workflow en koppel ze op node-niveau.
Wanneer de agent iets verkeerds zegt, is de reflex om "zeg X niet" aan de prompt toe te voegen. Drie hiervan en de prompt wordt tegenstrijdig; tien en het wordt onbeheersbaar. Zoek uit waarom de LLM X zei. Bijna altijd suggereerde een chunk in de KB het, of dwong het ontbreken van een chunk het model terug te vallen op trainingsdata. Patch de bron.
Elke extra chunk voegt tokens toe aan de prompt en milliseconden aan de reactie. "Chunks to retrieve" op 10 zetten omdat meer context veiliger voelt is een veelgemaakte fout. Blijf op 3 chunks voor typische supportcontent, verhoog naar 5 alleen wanneer bellervragen meerdere onderwerpen bestrijken, en ga nooit hoger tenzij je hebt gemeten dat het de nauwkeurigheid verbetert.
Omdat de agent mag spreken zonder een expliciete weigerinstructie. De Air Canada-chatbot werd aansprakelijk gehouden nadat hij een niet-bestaand rouwbeleid genereerde dat de daadwerkelijke regels van de luchtvaartmaatschappij tegensprak, en soortgelijke mislukkingen blijven terugkeren bij leveranciers die de weigerlaag overslaan. Maak de weigering expliciet, test dat hij afgaat, en behandel elk geval waarin de agent informatie verzint als een P0-bug. CanLII
Een nieuw document toevoegen verandert het retrieval-landschap voor elke bestaande query. Een chunk die gisteren eerste stond, kan vandaag derde staan. Houd de 50-vragen-testset geautomatiseerd en voer hem opnieuw uit wanneer de onderliggende content betekenisvol verandert.
SWTCH rolde een door Retell aangedreven stemagent genaamd Lucas uit om supportgesprekken over EV-laders af te handelen, waarbij bellers doorgaans bij een dode lader staan met een lage batterij en geen geduld voor een verkeerde instructie. De implementatie verlaagde de supportkosten met meer dan 50% en verbeterde de SaaS-marges aanzienlijk, waarbij de agent binnen seconden in plaats van minuten antwoordt. De betrouwbaarheidslat werd gezet door de use case: een verkeerde probleemoplossingsstap is het verschil tussen een werkende lader en een gestrande bestuurder.
Anker rolde Retell uit over wereldwijde support voor consumentenelektronica, waar bellers productspecifieke vragen stellen over tientallen SKU's en meerdere talen. De case study illustreert waarom metadata-scoping op schaal belangrijk is. Zonder filtering op productniveau bij retrieval kan een soundbar-vraag een stofzuigerhandleiding ophalen, en zal de agent ze zelfverzekerd combineren. Met een goede KB-structuur blijft de agent het hele gesprek binnen de productcontext.
Retell AI voedt nu 50M+ realtime AI-telefoongesprekken per maand aan voor klanten in duizenden bedrijven, zonder dat er over dat volume een agent is gemeld die uit de bocht vloog. De architectuur in deze gids is dezelfde die onder die gesprekken draait. Yahoo Finance
Recursieve chunking bij 512 tokens met 10-15% overlap is de benchmark-gevalideerde standaard. Kleinere chunks (200-300 tokens) werken voor FAQ-achtige content; grotere chunks (1024 tokens) werken voor verhalende tekst. Splits altijd eerst op Markdown-koppen, dan op alinea's, dan op zinnen.
Voeg een expliciete weigerinstructie toe aan de agent-prompt: "Antwoord alleen met de informatie in ## Related Knowledge Base Contexts. Als die sectie ontbreekt of geen relevante informatie bevat, reageer dan dat er geen gerelateerde informatie beschikbaar is." Gecombineerd met een similariteitsdrempel van 0,65 of hoger is dit de meest effectieve enkelvoudige anti-hallucinatiecontrole.
Minder dan 100ms per beurt op de geoptimaliseerde retrieval-pijplijn van Retell, waardoor de agent binnen het totale reactievenster van ~600ms blijft dat bellers verwachten. Als je materieel hogere latency ziet, controleer dan of je meer chunks ophaalt dan je nodig hebt, of dat metadata-filtering tijdens de query wordt toegepast in plaats van na retrieval.
Conversation flow wint voor software-support en elk scenario waarbij de intentie van de beller opsplitst in aparte workflows. Kennisbanken op node-niveau laten elke gespreksstatus ophalen uit een gericht stuk content, wat de nauwkeurigheid verbetert en het onderhoud eenvoudig maakt. Enkele prompts werken voor smalle use cases zoals een FAQ voor één product. De gids van Retell over het uitrollen van conversationele AI behandelt de architecturale keuze in meer detail.
Schakel auto-refresh in op URL-bronnen zodat Retell elke 24 uur opnieuw ophaalt. Voor geΓΌploade documenten voer je een handmatige review uit wanneer het onderliggende product of beleid verandert, en behandel je alles ouder dan 90 dagen als iets dat verificatie nodig heeft.
Ja, gedeeltelijk. Je kunt succesvolle gesprekstranscripten en opnames van senior medewerkers als bronmateriaal voor de kennisbank gebruiken. Extraheer de vraag-en-antwoord-paren, converteer ze naar Markdown en indexeer ze naast je formele documentatie. Dit is vooral nuttig om de specifieke bewoording vast te leggen die je beste medewerkers gebruiken, die problemen vaak sneller oplost dan de officiΓ«le helpcentrum-tekst. Het vervangt gestructureerde documentatie niet; het vult die aan.
Minimaal: product, version, region, audience en last_verified_date. Voeg topic toe voor granulaire routing in een conversation flow, en compliance_scope als je gereguleerde content hebt (HIPAA, financieel advies) die nooit buiten specifieke gesprekscontexten opgehaald mag worden.
Bouw een testset van 50-100 echte bellervragen van de afgelopen 30 dagen aan supporttickets. Inspecteer voor elk de opgehaalde chunks vΓ³Γ³r enige LLM-generatie: staat de juiste chunk in de top 3, ligt de similariteitsscore boven de drempel, en zou een mens de vraag alleen uit die chunks kunnen beantwoorden. Streef naar 90%+ retrieval-nauwkeurigheid op de testset voordat je uitrolt.
Met een weigerinstructie op zijn plaats en een similariteitsdrempel van 0,65 of hoger, zegt de agent dat hij die informatie niet gedocumenteerd heeft en biedt hij ofwel aan om een bericht op te nemen ofwel verbindt hij warm door via gespreksoverdracht naar een menselijke agent met volledige gesprekscontext. Zonder deze controles valt de agent terug op de trainingsdata van de onderliggende LLM, wat precies de faalmodus is die deze gids beoogt te voorkomen.
Je hebt nu een kennisbank-architectuur die elke reactie van de agent baseert op geverifieerde content, retrieval scoped naar de bellercontext, weigert te antwoorden wanneer het antwoord niet gedocumenteerd is, en zichzelf bijwerkt naarmate je bronmateriaal verandert. Dit is de basis die een stemagent in staat stelt software-support, gereguleerde sectoren, of elk gesprek met hoge inzet af te handelen waarbij een verkeerde stap zwaarder weegt dan een snelle.
Om dit verder uit te breiden ondersteunt dezelfde retrieval-architectuur use cases zoals AI-klantenservice-automatisering, leadkwalificatie met productspecifieke routing, en AI-aangedreven receptionisten voor zorgpraktijken waar compliance-scoping niet onderhandelbaar is. Dezelfde patronen zijn ook toepasbaar op implementaties in de zorg en verzekeringen waar de kosten van een hallucinatie een kwestie van regelgeving zijn, niet slechts een van klantervaring.
Begin gratis met bouwen met $10 aan gebruikstegoed op retellai.com.
See how much your business could save by switching to AI-powered voice agents.
Total Human Agent Cost
AI Agent Cost
Estimated Savings
Een demodemonummer van Retell Clinic Office

Start building smarter conversations today.


.avif)
.avif)