Röst-AI-benchmark: Retell rankas #1 för workflow-precision inom Medicare

Röst-AI-benchmark: Retell rankas #1 för workflow-precision inom Medicare
BACK TO BLOGS
Add Retell AI as a preferred source on Google
ON THIS PAGE
Back to top

En ny röst-AI-benchmark tog en Medicare-försäkringsagent, placerade den på sex olika plattformar utan att ändra en enda rad och mätte vilken som faktiskt följde workflowet. Retell kom först.

Testet kom från Cekura, ett oberoende företag som bygger utvärderingsramverk för röstagenter. Deras Medicare-experiment omfattade totalt 414 samtal och betygsatte varje plattform utifrån hur tillförlitligt den hanterade ett reglerat försäkringssamtal.

Retell ledde fältet med 95,7 % workflow-precision och klarade 22 av 23 kontroller. Alla övriga plattformar landade mellan 65,2 % och 95,7 %, trots att de alla körde exakt samma agent.

TL;DR

  • Cekura driftsatte en byte-identisk Medicare-agent på sex röstplattformar och körde 414 samtal.

  • Retell rankades #1 med 95,7 % workflow-precision och klarade 22 av 23 utvärderare.

  • Resultaten i fältet sträckte sig från 65,2 % till 95,7 %, så det var plattformen och inte agenten som avgjorde skillnaden.

  • Retell höll också förstaplatsen vid strikt end-to-end-bedömning, som räknar in fel under körning, även där med 95,7 %.

  • I ett reglerat Medicare-samtal är den skillnaden avgörande mellan en regelefterlevande överlämning och ett brutet eller icke-regelefterlevande samtal.

Vad Cekuras röst-AI-benchmark testade

Cekura byggde en Medicare-TPMO-agent och driftsatte en byte-identisk kopia på var och en av de sex plattformarna. Samma prompt, samma verktyg, samma röst. Den enda variabeln var plattformen som körde under huven.

En TPMO är en tredjepartsmarknadsföringsorganisation, den typ av licensierad byrå som säljer Medicare Advantage- och Part D-planer. Dessa samtal är strikt reglerade, så agenten måste göra mycket rätt, och i en fast ordning.

Benchmarken använde 23 utvärderare, var och en riktad mot en punkt där försäkringssamtal ofta brister. De delades in i fyra grupper: att öppna samtalet och få samtycke, att ta reda på vad den som ringer faktiskt behöver, att kvalificera och registrera leadet, samt att hålla sig inom gränserna för konsumentskydd.

Varje utvärderare kördes tre gånger på varje plattform, och en plattform fick godkänt bara om alla tre körningarna passerade – ett mått som Cekura kallar pass^3. Tjugotre utvärderare, tre körningar var, över sex plattformar blir totalt 414 samtal. Du kan läsa metodiken och körningarna per plattform på Cekuras benchmark-sida.

Resultaten: Retell rankades #1 med 95,7 %

Så här presterade de sex plattformarna, sorterade efter workflow-precision:

PlattformWorkflow pass^3Strikt end-to-end pass^3
Retell95,7 % (22/23)95,7 % (22/23)
ElevenLabs91,3 % (21/23)91,3 % (21/23)
Pipecat82,6 % (19/23)73,9 % (17/23)
LiveKit73,9 % (17/23)73,9 % (17/23)
Synthflow69,6 % (16/23)8,7 % (2/23)
Vapi65,2 % (15/23)65,2 % (15/23)

Retell var den enda plattformen som klarade 95 % i workflow-precision, och den behöll det resultatet även under det striktare måttet som förklaras nedan.

Två sätt att mäta tillförlitlighet

Cekura rapporterade två resultat, eftersom en röstagent kan misslyckas på två olika sätt.

Workflow pass^3 mäter om agenten valde rätt åtgärd och anropade sina verktyg korrekt. Den använder två signaler som Cekura kallar Expected Outcome och Mock Tool Accuracy.

Strikt end-to-end pass^3 lägger till en andra fråga: kom den som ringde faktiskt igenom uppgiften? Måttet räknar in infrastrukturfel, som att agenten stannar mitt i samtalet, som hindrar en person från att slutföra ärendet även om den avsedda åtgärden var rätt.

Retell fick 95,7 % på båda, så plattformen tappade ingen mark på grund av problem under körning. Vissa plattformar gjorde det. Synthflow klarade 16 av 23 utvärderare i workflow-precision men bara 2 av 23 under strikt bedömning, eftersom de som ringde ofta fick sitta genom långa tystnader under verktygsanvändning utan tecken på att agenten fortfarande arbetade.

Varför workflow-precision spelar roll i Medicare-samtal

I ett Medicare-säljsamtal svarar agenten inte bara på frågor. Den måste leverera den obligatoriska informationen, få samtycke innan planer diskuteras, undvika att ge personlig rådgivning och koppla den som ringer till en licensierad människa vid rätt tidpunkt.

De stegen fastställs av federala TPMO-regler, och att hoppa över ett av dem är ett regelefterlevnadsproblem, inte en skönhetsfläck.

Det var precis vad de 23 utvärderarna testade. Någon avbryter informationen och kräver plandetaljer. En familjemedlem ringer på uppdrag av en förmånstagare. Någon ber agenten att lova att en plan täcker deras medicin. Rätt agerande är specifikt i varje fall, och en plattform som stannar upp eller improviserar sviker både personen som ringer och regelefterlevnaden på en gång.

Benchmarken visar att det inte räcker att köra samma agent. Plattformen under huven avgör om agenten håller i de mest riskfyllda samtalen.

Var Retell passar in

Retell är en plattform för att bygga, testa, driftsätta och övervaka AI-röstagenter som ringer och tar emot telefonsamtal. Benchmarken belönade två saker som Retell är byggd kring: att följa ett flerstegs-workflow och att anropa verktyg korrekt under press.

  • Förberedd överföring till en licensierad människa: när den som ringer behöver en person lämnar agenten över med den kontext den redan samlat in, via samtalsöverföring.

  • Svar från en kunskapsbas, inte rådgivning utanför manus: agenten hämtar faktabaserade svar från en ansluten kunskapsbas och håller sig inom det den får säga.

  • Varje samtal granskas i efterhand: team använder analys efter samtal och AI-baserad QA för att se var ett flöde höll och var det brast.

  • Byggd för reglerade branscher: Retell driver röstagenter för team inom vård och försäkring, där ordningen på stegen i ett samtal inte är valfri.

Det här är ett oberoende test av ett workflow, och resultaten varierar beroende på hur en agent byggs och underhålls. Ändå kom Retell ut i topp i en svår, reglerad uppgift.

Vanliga frågor

Vad är en röst-AI-benchmark?

En röst-AI-benchmark är ett kontrollerat test som kör samma uppgift på olika röstagentplattformar och betygsätter hur väl var och en hanterar den. Cekuras version använder upprepade samtal och fasta utvärderare så att jämförelsen förblir rättvis.

Vem genomförde benchmarken?

Cekura, ett oberoende företag som bygger utvärderingsverktyg för röstagenter. Retell genomförde inte testet och betygsatte inte sig själv.

Vad betyder pass^3?

En plattform måste klara en utvärderare i tre separata körningar för att få godkänt. En turlig körning räknas inte, vilket gör resultatet till ett test av konsekvens snarare än ett enskilt lyckat samtal.

Körde alla plattformar samma agent?

Ja. Cekura driftsatte en byte-identisk Medicare-agent på alla sex plattformarna, med samma prompt, verktyg och röst, så all skillnad i resultat kommer från plattformen och inte från agenten.

Var kan jag se de fullständiga resultaten?

Cekura publicerar körningarna per plattform och hela metodiken på sin benchmark-sida, inklusive en genomgång av varje utvärderare i Medicare-experimentet.

Bygg en röstagent som håller i de svåra samtalen.

Med Retell kan du bygga, testa och lansera en AI-röstagent och sedan följa hur den presterar i varje samtal. Testa Retell gratis eller kontakta säljteamet.

ROI Calculator
Estimate Your ROI from Automating Calls

See how much your business could save by switching to AI-powered voice agents.

All done! 
Your submission has been sent to your email
Oops! Something went wrong while submitting the form.
   1
   8
20
Oops! Something went wrong while submitting the form.

ROI Result

2,000

Total Human Agent Cost

$5,000
/month

AI Agent Cost

$3,000
/month

Estimated Savings

$2,000
/month
Live Demo
Prova vår live-demo

Ett demonummer från Retell Clinic Office

Tack! Din inskickning har mottagits!
Hoppsan! Något gick fel när formuläret skickades.

Read Other Blogs

Revolutionize your call operation with Retell