Stemme-AI-benchmark: Retell er nr. 1 i workflow-nøjagtighed for Medicare

Stemme-AI-benchmark: Retell er nr. 1 i workflow-nøjagtighed for Medicare
BACK TO BLOGS
Add Retell AI as a preferred source on Google
ON THIS PAGE
Back to top

En ny stemme-AI-benchmark tog én Medicare-forsikringsagent, satte den på seks forskellige platforme uden at ændre en enkelt linje og målte, hvilken der reelt fulgte workflowet. Retell kom ind på førstepladsen.

Testen kom fra Cekura, en uafhængig virksomhed, der bygger evalueringsopsætninger til stemmeagenter. Deres Medicare-eksperiment gennemførte 414 opkald i alt og gav hver platform en score for, hvor pålideligt den håndterede en reguleret forsikringssamtale.

Retell førte feltet med 95,7 % workflow-nøjagtighed og klarede 22 af de 23 tjek. Alle andre platforme landede mellem 65,2 % og 95,7 %, selv om de alle kørte den identiske agent.

TL;DR

  • Cekura implementerede én byte-identisk Medicare-agent på seks stemmeplatforme og gennemførte 414 opkald.

  • Retell blev nr. 1 med 95,7 % workflow-nøjagtighed og bestod 22 af 23 evaluatorer.

  • Scorerne i feltet gik fra 65,2 % til 95,7 %, så det var platformen, ikke agenten, der gjorde forskellen.

  • Retell holdt også førstepladsen under streng end-to-end-bedømmelse, som tæller runtime-fejl med, igen med 95,7 %.

  • På et reguleret Medicare-opkald er det spring forskellen mellem en compliant viderestilling af opkald og et opkald, der falder ud eller ikke er compliant.

Hvad Cekuras stemme-AI-benchmark testede

Cekura byggede én Medicare-TPMO-agent og implementerede en byte-identisk kopi på hver af de seks platforme. Samme prompt, samme værktøjer, samme stemme. Den eneste variabel var platformen, der kørte nedenunder.

En TPMO er en third-party marketing organization, altså den type autoriserede agentur, der sælger Medicare Advantage- og Part D-planer. Disse opkald er stramt reguleret, så agenten skal have styr på mange ting — og i en fast rækkefølge.

Benchmarken brugte 23 evaluatorer, som hver især ramte et punkt, hvor forsikringsopkald typisk bryder sammen. De faldt i fire grupper: åbne opkaldet og få tilladelse, finde ud af hvad den, der ringer, faktisk har brug for, kvalificere og registrere leadet, og holde sig inden for forbrugerbeskyttelsens grænser.

Hver evaluator kørte tre gange på hver platform, og en platform fik kun point, hvis alle tre kørsler bestod — et mål, Cekura kalder pass^3. 23 evaluatorer, tre kørsler hver, på tværs af seks platforme giver de samlede 414 opkald. Du kan læse metoden og kørslerne pr. platform på Cekuras benchmark-side.

Resultaterne: Retell blev nr. 1 med 95,7 %

Her er de seks platformes scorer, sorteret efter workflow-nøjagtighed:

PlatformWorkflow pass^3Streng end-to-end pass^3
Retell95,7 % (22/23)95,7 % (22/23)
ElevenLabs91,3 % (21/23)91,3 % (21/23)
Pipecat82,6 % (19/23)73,9 % (17/23)
LiveKit73,9 % (17/23)73,9 % (17/23)
Synthflow69,6 % (16/23)8,7 % (2/23)
Vapi65,2 % (15/23)65,2 % (15/23)

Retell var den eneste platform, der kom over 95 % i workflow-nøjagtighed, og den holdt scoren under det strengere mål, der forklares nedenfor.

To måder at måle pålidelighed

Cekura rapporterede to scorer, fordi en stemmeagent kan fejle på to forskellige måder.

Workflow pass^3 spørger, om agenten valgte den rigtige handling og kaldte sine værktøjer korrekt. Den bruger to signaler, som Cekura kalder Expected Outcome og Mock Tool Accuracy.

Streng end-to-end pass^3 tilføjer et ekstra spørgsmål: kom den, der ringede, faktisk igennem opgaven? Den tæller infrastrukturfejl med, som at agenten går i stå midt i opkaldet og forhindrer den, der ringer, i at nå til ende, selv når den tilsigtede handling var rigtig.

Retell scorede 95,7 % på begge, så den mistede ikke terræn på runtime-problemer. Nogle platforme gjorde. Synthflow bestod 16 af 23 evaluatorer på workflow-nøjagtighed, men kun 2 af 23 under streng bedømmelse, fordi de, der ringede, under brug af værktøjer ofte sad igennem lange pauser uden tegn på, at agenten stadig arbejdede.

Hvorfor workflow-nøjagtighed betyder noget ved Medicare-opkald

På et Medicare-salgsopkald svarer agenten ikke blot på spørgsmål. Den skal levere den påkrævede oplysningstekst, opnå samtykke før den drøfter planer, undgå at give personlig rådgivning og sende den, der ringer, videre til et autoriseret menneske på det rigtige tidspunkt.

De trin er fastsat af føderale TPMO-regler, og at springe et af dem over er et compliance-problem, ikke en skønhedsfejl.

Det var det, de 23 evaluatorer undersøgte. En person afbryder oplysningsteksten og kræver detaljer om planen. Et familiemedlem ringer på vegne af en berettiget. En person beder agenten om at love, at en plan dækker deres medicin. Det rigtige træk er specifikt i hvert tilfælde, og en platform, der går i stå eller improviserer, svigter både den, der ringer, og compliance-dokumentationen på én gang.

Benchmarken viser, at det ikke er nok at køre den samme agent. Platformen nedenunder afgør, om agenten holder på de mest risikofyldte opkald.

Hvor Retell passer ind

Retell er en platform til at bygge, teste, implementere og overvåge AI-stemmeagenter, der foretager og modtager opkald. Benchmarken belønnede to ting, som Retell er bygget omkring: at følge et workflow med flere trin og at kalde værktøjer korrekt under pres.

  • Assisteret viderestilling til et autoriseret menneske: når den, der ringer, har brug for en person, sender agenten opkaldet videre med den kontekst, den allerede har indsamlet, via viderestilling af opkald.

  • Svar fra en vidensbase, ikke rådgivning uden for scriptet: agenten henter faktuelle svar fra en tilkoblet vidensbase og holder sig inden for det, den må sige.

  • Alle opkald gennemgås bagefter: teams bruger analyse efter opkald og AI-kvalitetssikring til at se, hvor et flow holdt, og hvor det glippede.

  • Bygget til regulerede brancher: Retell kører stemmeagenter for teams inden for sundhedssektoren og forsikring, hvor rækkefølgen af handlinger i et opkald ikke er til forhandling.

Dette er én uafhængig test af ét workflow, og resultaterne varierer efter, hvordan en agent bygges og vedligeholdes. Alligevel kom Retell foran feltet på en svær, reguleret opgave.

Ofte stillede spørgsmål

Hvad er en stemme-AI-benchmark?

En stemme-AI-benchmark er en kontrolleret test, der kører den samme opgave på tværs af forskellige stemmeagent-platforme og giver point for, hvor godt hver enkelt håndterer den. Cekuras version bruger gentagne opkald og faste evaluatorer, så sammenligningen bliver fair.

Hvem stod bag benchmarken?

Cekura, en uafhængig virksomhed, der bygger evalueringsværktøjer til stemmeagenter. Retell hverken kørte testen eller bedømte sig selv.

Hvad betyder pass^3?

En platform skulle bestå en evaluator i tre separate kørsler for at få point for den. Én heldig kørsel tæller ikke, og det gør scoren til en test af konsistens frem for et enkelt godt opkald.

Kørte alle platforme den samme agent?

Ja. Cekura implementerede en byte-identisk Medicare-agent på alle seks platforme med samme prompt, værktøjer og stemme, så enhver forskel i score kommer fra platformen, ikke agenten.

Hvor kan jeg se de fulde resultater?

Cekura offentliggør kørslerne pr. platform og den fulde metode på sin benchmark-side, inklusive en gennemgang af hver evaluator i Medicare-eksperimentet.

Byg en stemmeagent, der holder på de svære opkald.

Med Retell kan du bygge, teste og lancere en AI-stemmeagent og derefter følge, hvordan den præsterer på hvert opkald. Prøv Retell gratis eller kontakt salg.

ROI Calculator
Estimate Your ROI from Automating Calls

See how much your business could save by switching to AI-powered voice agents.

All done! 
Your submission has been sent to your email
Oops! Something went wrong while submitting the form.
   1
   8
20
Oops! Something went wrong while submitting the form.

ROI Result

2,000

Total Human Agent Cost

$5,000
/month

AI Agent Cost

$3,000
/month

Estimated Savings

$2,000
/month
Live Demo
Prøv vores live demo

Et demonummer fra Retell Clinic Office

Tak! Din indsendelse er modtaget!
Ups! Noget gik galt under indsendelsen af formularen.

Read Other Blogs

Revolutionize your call operation with Retell