Röst-AI-benchmark: Retell rankas #1 för workflow-precision inom Medicare


En ny röst-AI-benchmark tog en Medicare-försäkringsagent, placerade den på sex olika plattformar utan att ändra en enda rad och mätte vilken som faktiskt följde workflowet. Retell kom först.
Testet kom från Cekura, ett oberoende företag som bygger utvärderingsramverk för röstagenter. Deras Medicare-experiment omfattade totalt 414 samtal och betygsatte varje plattform utifrån hur tillförlitligt den hanterade ett reglerat försäkringssamtal.
Retell ledde fältet med 95,7 % workflow-precision och klarade 22 av 23 kontroller. Alla övriga plattformar landade mellan 65,2 % och 95,7 %, trots att de alla körde exakt samma agent.
TL;DR
Cekura driftsatte en byte-identisk Medicare-agent på sex röstplattformar och körde 414 samtal.
Retell rankades #1 med 95,7 % workflow-precision och klarade 22 av 23 utvärderare.
Resultaten i fältet sträckte sig från 65,2 % till 95,7 %, så det var plattformen och inte agenten som avgjorde skillnaden.
Retell höll också förstaplatsen vid strikt end-to-end-bedömning, som räknar in fel under körning, även där med 95,7 %.
I ett reglerat Medicare-samtal är den skillnaden avgörande mellan en regelefterlevande överlämning och ett brutet eller icke-regelefterlevande samtal.
Cekura byggde en Medicare-TPMO-agent och driftsatte en byte-identisk kopia på var och en av de sex plattformarna. Samma prompt, samma verktyg, samma röst. Den enda variabeln var plattformen som körde under huven.
En TPMO är en tredjepartsmarknadsföringsorganisation, den typ av licensierad byrå som säljer Medicare Advantage- och Part D-planer. Dessa samtal är strikt reglerade, så agenten måste göra mycket rätt, och i en fast ordning.
Benchmarken använde 23 utvärderare, var och en riktad mot en punkt där försäkringssamtal ofta brister. De delades in i fyra grupper: att öppna samtalet och få samtycke, att ta reda på vad den som ringer faktiskt behöver, att kvalificera och registrera leadet, samt att hålla sig inom gränserna för konsumentskydd.
Varje utvärderare kördes tre gånger på varje plattform, och en plattform fick godkänt bara om alla tre körningarna passerade – ett mått som Cekura kallar pass^3. Tjugotre utvärderare, tre körningar var, över sex plattformar blir totalt 414 samtal. Du kan läsa metodiken och körningarna per plattform på Cekuras benchmark-sida.
Så här presterade de sex plattformarna, sorterade efter workflow-precision:
| Plattform | Workflow pass^3 | Strikt end-to-end pass^3 |
|---|---|---|
| Retell | 95,7 % (22/23) | 95,7 % (22/23) |
| ElevenLabs | 91,3 % (21/23) | 91,3 % (21/23) |
| Pipecat | 82,6 % (19/23) | 73,9 % (17/23) |
| LiveKit | 73,9 % (17/23) | 73,9 % (17/23) |
| Synthflow | 69,6 % (16/23) | 8,7 % (2/23) |
| Vapi | 65,2 % (15/23) | 65,2 % (15/23) |
Retell var den enda plattformen som klarade 95 % i workflow-precision, och den behöll det resultatet även under det striktare måttet som förklaras nedan.
Cekura rapporterade två resultat, eftersom en röstagent kan misslyckas på två olika sätt.
Workflow pass^3 mäter om agenten valde rätt åtgärd och anropade sina verktyg korrekt. Den använder två signaler som Cekura kallar Expected Outcome och Mock Tool Accuracy.
Strikt end-to-end pass^3 lägger till en andra fråga: kom den som ringde faktiskt igenom uppgiften? Måttet räknar in infrastrukturfel, som att agenten stannar mitt i samtalet, som hindrar en person från att slutföra ärendet även om den avsedda åtgärden var rätt.
Retell fick 95,7 % på båda, så plattformen tappade ingen mark på grund av problem under körning. Vissa plattformar gjorde det. Synthflow klarade 16 av 23 utvärderare i workflow-precision men bara 2 av 23 under strikt bedömning, eftersom de som ringde ofta fick sitta genom långa tystnader under verktygsanvändning utan tecken på att agenten fortfarande arbetade.
I ett Medicare-säljsamtal svarar agenten inte bara på frågor. Den måste leverera den obligatoriska informationen, få samtycke innan planer diskuteras, undvika att ge personlig rådgivning och koppla den som ringer till en licensierad människa vid rätt tidpunkt.
De stegen fastställs av federala TPMO-regler, och att hoppa över ett av dem är ett regelefterlevnadsproblem, inte en skönhetsfläck.
Det var precis vad de 23 utvärderarna testade. Någon avbryter informationen och kräver plandetaljer. En familjemedlem ringer på uppdrag av en förmånstagare. Någon ber agenten att lova att en plan täcker deras medicin. Rätt agerande är specifikt i varje fall, och en plattform som stannar upp eller improviserar sviker både personen som ringer och regelefterlevnaden på en gång.
Benchmarken visar att det inte räcker att köra samma agent. Plattformen under huven avgör om agenten håller i de mest riskfyllda samtalen.
Retell är en plattform för att bygga, testa, driftsätta och övervaka AI-röstagenter som ringer och tar emot telefonsamtal. Benchmarken belönade två saker som Retell är byggd kring: att följa ett flerstegs-workflow och att anropa verktyg korrekt under press.
Förberedd överföring till en licensierad människa: när den som ringer behöver en person lämnar agenten över med den kontext den redan samlat in, via samtalsöverföring.
Svar från en kunskapsbas, inte rådgivning utanför manus: agenten hämtar faktabaserade svar från en ansluten kunskapsbas och håller sig inom det den får säga.
Varje samtal granskas i efterhand: team använder analys efter samtal och AI-baserad QA för att se var ett flöde höll och var det brast.
Byggd för reglerade branscher: Retell driver röstagenter för team inom vård och försäkring, där ordningen på stegen i ett samtal inte är valfri.
Det här är ett oberoende test av ett workflow, och resultaten varierar beroende på hur en agent byggs och underhålls. Ändå kom Retell ut i topp i en svår, reglerad uppgift.
En röst-AI-benchmark är ett kontrollerat test som kör samma uppgift på olika röstagentplattformar och betygsätter hur väl var och en hanterar den. Cekuras version använder upprepade samtal och fasta utvärderare så att jämförelsen förblir rättvis.
Cekura, ett oberoende företag som bygger utvärderingsverktyg för röstagenter. Retell genomförde inte testet och betygsatte inte sig själv.
En plattform måste klara en utvärderare i tre separata körningar för att få godkänt. En turlig körning räknas inte, vilket gör resultatet till ett test av konsekvens snarare än ett enskilt lyckat samtal.
Ja. Cekura driftsatte en byte-identisk Medicare-agent på alla sex plattformarna, med samma prompt, verktyg och röst, så all skillnad i resultat kommer från plattformen och inte från agenten.
Cekura publicerar körningarna per plattform och hela metodiken på sin benchmark-sida, inklusive en genomgång av varje utvärderare i Medicare-experimentet.
Bygg en röstagent som håller i de svåra samtalen.
Med Retell kan du bygga, testa och lansera en AI-röstagent och sedan följa hur den presterar i varje samtal. Testa Retell gratis eller kontakta säljteamet.
See how much your business could save by switching to AI-powered voice agents.
Total Human Agent Cost
AI Agent Cost
Estimated Savings
Ett demonummer från Retell Clinic Office

Start building smarter conversations today.

