Voice-AI-benchmark: Retell is #1 op workflow-nauwkeurigheid bij Medicare


Een nieuwe voice-AI-benchmark nam één Medicare-verzekeringsagent, zette die op zes verschillende platforms zonder één regel te wijzigen en meette welk platform de workflow daadwerkelijk volgde. Retell eindigde op de eerste plaats.
De test kwam van Cekura, een onafhankelijk bedrijf dat evaluatieframeworks bouwt voor stemagenten. Het Medicare-experiment omvatte in totaal 414 gesprekken en beoordeelde elk platform op hoe betrouwbaar het een gereguleerd verzekeringsgesprek afhandelde.
Retell ging aan de leiding met 95,7% workflow-nauwkeurigheid en haalde 22 van de 23 checks. Alle andere platforms kwamen uit tussen 65,2% en 95,7%, ook al draaiden ze allemaal exact dezelfde agent.
TL;DR
Cekura rolde één byte-identieke Medicare-agent uit op zes voice-platforms en voerde 414 gesprekken uit.
Retell eindigde op #1 met 95,7% workflow-nauwkeurigheid en slaagde voor 22 van de 23 evaluators.
De scores in het veld liepen van 65,2% tot 95,7%, dus het platform maakte het verschil, niet de agent.
Retell hield ook de eerste plaats onder de strikte end-to-end-beoordeling, die runtime-fouten meetelt, opnieuw met 95,7%.
Bij een gereguleerd Medicare-gesprek is dat verschil het verschil tussen een compliant doorverbinding en een afgebroken of non-compliant gesprek.
Cekura bouwde één Medicare-TPMO-agent en rolde een byte-identieke kopie uit op elk van de zes platforms. Dezelfde prompt, dezelfde tools, dezelfde stem. De enige variabele was het onderliggende platform.
Een TPMO is een third-party marketing organization: het soort gelicentieerde bureau dat Medicare Advantage- en Part D-plannen verkoopt. Deze gesprekken zijn streng gereguleerd, dus de agent moet veel goed doen, en in een vaste volgorde.
De benchmark gebruikte 23 evaluators, elk gericht op een punt waar verzekeringsgesprekken vaak stuklopen. Ze vielen in vier groepen: het gesprek openen en toestemming krijgen, uitzoeken wat de beller echt nodig heeft, de lead kwalificeren en vastleggen, en binnen de grenzen van consumentenbescherming blijven.
Elke evaluator liep drie keer op elk platform, en een platform kreeg alleen krediet als alle drie de runs slaagden β een maatstaf die Cekura pass^3 noemt. DrieΓ«ntwintig evaluators, elk drie runs, op zes platforms komt uit op de volledige 414 gesprekken. Je kunt de methodologie en de runs per platform lezen op de benchmarkpagina van Cekura.
Zo scoorden de zes platforms, gesorteerd op workflow-nauwkeurigheid:
| Platform | Workflow pass^3 | Strikte end-to-end pass^3 |
|---|---|---|
| Retell | 95,7% (22/23) | 95,7% (22/23) |
| ElevenLabs | 91,3% (21/23) | 91,3% (21/23) |
| Pipecat | 82,6% (19/23) | 73,9% (17/23) |
| LiveKit | 73,9% (17/23) | 73,9% (17/23) |
| Synthflow | 69,6% (16/23) | 8,7% (2/23) |
| Vapi | 65,2% (15/23) | 65,2% (15/23) |
Retell was het enige platform dat 95% op workflow-nauwkeurigheid haalde, en het hield die score ook onder de striktere maatstaf die hieronder wordt uitgelegd.
Cekura rapporteerde twee scores, omdat een stemagent op twee verschillende manieren kan falen.
Workflow pass^3 kijkt of de agent de juiste actie koos en zijn tools correct aanriep. Het gebruikt twee signalen die Cekura Expected Outcome en Mock Tool Accuracy noemt.
Strikte end-to-end pass^3 voegt een tweede vraag toe: kwam de beller de taak daadwerkelijk door? Het telt infrastructuurfouten mee, zoals een agent die halverwege het gesprek vastloopt, waardoor een beller niet kan afronden, zelfs als de bedoelde actie juist was.
Retell scoorde 95,7% op beide, dus het verloor geen terrein door runtime-problemen. Sommige platforms wel. Synthflow slaagde voor 16 van de 23 evaluators op workflow-nauwkeurigheid, maar slechts voor 2 van de 23 onder de strikte beoordeling, omdat bellers tijdens het gebruik van tools vaak lange stiltes moesten uitzitten zonder enig teken dat de agent nog werkte.
Bij een Medicare-verkoopgesprek beantwoordt de agent niet alleen vragen. Hij moet de verplichte disclosure uitspreken, toestemming krijgen voordat plannen worden besproken, geen persoonlijk advies geven en de beller op het juiste moment doorverbinden met een gelicentieerde medewerker.
Die stappen zijn vastgelegd in federale TPMO-regels, en er één overslaan is een compliance-probleem, geen schoonheidsfoutje.
Dat is wat de 23 evaluators onderzochten. Een beller onderbreekt de disclosure en eist plandetails. Een familielid belt namens een begunstigde. Een beller vraagt de agent te beloven dat een plan zijn medicatie dekt. De juiste zet is in elk geval specifiek, en een platform dat vastloopt of improviseert laat zowel de beller als het compliance-dossier in de steek.
De benchmark laat zien dat dezelfde agent draaien niet genoeg is. Het onderliggende platform bepaalt of die agent overeind blijft bij de gesprekken met het hoogste risico.
Retell is een platform om AI-stemagenten te bouwen, testen, uit te rollen en te monitoren die telefoongesprekken voeren en aannemen. De benchmark belonende twee dingen waar Retell om gebouwd is: een workflow met meerdere stappen volgen en tools correct aanroepen onder druk.
Warme doorverbinding naar een gelicentieerde medewerker: als een beller een mens nodig heeft, draagt de agent het gesprek over met de context die al verzameld is, via gespreksoverdracht.
Antwoorden uit een kennisbank, geen advies buiten het script: de agent haalt feitelijke antwoorden uit een gekoppelde kennisbank en blijft binnen wat hij mag zeggen.
Elk gesprek achteraf beoordeeld: teams gebruiken analyse na het gesprek en AI-kwaliteitscontrole om te zien waar een flow standhield en waar het misging.
Gebouwd voor gereguleerde sectoren: Retell laat stemagenten draaien voor teams in de zorg en verzekeringen, waar de volgorde van handelingen in een gesprek niet optioneel is.
Dit is één onafhankelijke test op één workflow, en resultaten variëren met hoe een agent is gebouwd en onderhouden. Toch kwam Retell bij een zware, gereguleerde taak als beste uit het veld.
Een voice-AI-benchmark is een gecontroleerde test die dezelfde taak uitvoert op verschillende stemagentplatforms en beoordeelt hoe goed elk platform die afhandelt. De versie van Cekura gebruikt herhaalde gesprekken en vaste evaluators, zodat de vergelijking eerlijk blijft.
Cekura, een onafhankelijk bedrijf dat evaluatietools bouwt voor stemagenten. Retell voerde de test niet uit en beoordeelde zichzelf niet.
Een platform moest een evaluator in drie afzonderlijke runs halen om er krediet voor te krijgen. Eén gelukkige run telt niet mee, waardoor de score consistentie test in plaats van één goed gesprek.
Ja. Cekura rolde een byte-identieke Medicare-agent uit op alle zes platforms, met dezelfde prompt, tools en stem, zodat elk verschil in score van het platform komt en niet van de agent.
Cekura publiceert de runs per platform en de volledige methodologie op zijn benchmarkpagina, inclusief een uitsplitsing van elke evaluator in het Medicare-experiment.
Bouw een stemagent die standhoudt bij de moeilijke gesprekken.
Met Retell bouw, test en lanceer je een AI-stemagent en zie je vervolgens hoe die presteert bij elk gesprek. Probeer Retell gratis of neem contact op met sales.
See how much your business could save by switching to AI-powered voice agents.
Total Human Agent Cost
AI Agent Cost
Estimated Savings
Een demodemonummer van Retell Clinic Office

Start building smarter conversations today.

