Benchmark di IA vocale: Retell è 1ª per accuratezza nei flussi Medicare

Benchmark di IA vocale: Retell è 1ª per accuratezza nei flussi Medicare
BACK TO BLOGS
Add Retell AI as a preferred source on Google
ON THIS PAGE
Back to top

Un nuovo benchmark di IA vocale ha preso un agente assicurativo Medicare, lo ha messo su sei piattaforme diverse senza cambiare una riga e ha misurato quale seguisse davvero il flusso di lavoro. Retell si è classificata prima.

Il test arriva da Cekura, un'azienda indipendente che sviluppa sistemi di valutazione per agenti vocali. L'esperimento Medicare ha totalizzato 414 chiamate e ha valutato ogni piattaforma in base all'affidabilità nel gestire una conversazione assicurativa regolamentata.

Retell ha guidato la classifica con il 95,7% di accuratezza nel flusso di lavoro, superando 22 dei 23 controlli. Tutte le altre piattaforme si sono collocate tra il 65,2% e il 95,7%, pur eseguendo lo stesso identico agente.

In sintesi

  • Cekura ha distribuito un unico agente Medicare identico byte per byte su sei piattaforme vocali, effettuando 414 chiamate.

  • Retell si è classificata al 1° posto con il 95,7% di accuratezza nel flusso di lavoro, superando 22 valutatori su 23.

  • I punteggi complessivi sono andati dal 65,2% al 95,7%: è stata quindi la piattaforma, non l'agente, a fare la differenza.

  • Retell ha mantenuto il primo posto anche con la valutazione end-to-end rigorosa, che conteggia gli errori di runtime, sempre al 95,7%.

  • In una chiamata Medicare regolamentata, quel divario è la differenza tra un passaggio conforme e uno interrotto o non conforme.

Cosa ha testato il benchmark di IA vocale di Cekura

Cekura ha creato un unico agente TPMO per Medicare e ne ha distribuito una copia identica byte per byte su ciascuna delle sei piattaforme. Stesso prompt, stessi strumenti, stessa voce. L'unica variabile era la piattaforma sottostante.

Una TPMO è una third-party marketing organization, il tipo di agenzia autorizzata che vende piani Medicare Advantage e Part D. Queste chiamate sono strettamente regolamentate, quindi l'agente deve fare molte cose correttamente, e in un ordine preciso.

Il benchmark ha usato 23 valutatori, ognuno focalizzato su un punto in cui le chiamate assicurative tendono a incrinarsi. Si dividevano in quattro gruppi: apertura della chiamata e ottenimento del consenso, individuazione di ciò che serve davvero al chiamante, qualificazione e raccolta del lead, e rispetto dei limiti di tutela del consumatore.

Ogni valutatore è stato eseguito tre volte su ciascuna piattaforma, e una piattaforma otteneva il punto solo se tutte tre le esecuzioni superavano il test, una metrica che Cekura chiama pass^3. Ventitré valutatori, tre esecuzioni ciascuno, su sei piattaforme: si arriva così alle 414 chiamate totali. Puoi leggere la metodologia e le esecuzioni per singola piattaforma sulla pagina del benchmark di Cekura.

I risultati: Retell al 1° posto con il 95,7%

Ecco i punteggi delle sei piattaforme, ordinati per accuratezza nel flusso di lavoro:

Piattaformapass^3 sul flusso di lavoropass^3 end-to-end rigoroso
Retell95,7% (22/23)95,7% (22/23)
ElevenLabs91,3% (21/23)91,3% (21/23)
Pipecat82,6% (19/23)73,9% (17/23)
LiveKit73,9% (17/23)73,9% (17/23)
Synthflow69,6% (16/23)8,7% (2/23)
Vapi65,2% (15/23)65,2% (15/23)

Retell è stata l'unica piattaforma a superare il 95% di accuratezza nel flusso di lavoro, e ha mantenuto quel punteggio anche con la metrica più severa spiegata qui sotto.

Due modi per misurare l'affidabilità

Cekura ha riportato due punteggi perché un agente vocale può fallire in due modi diversi.

Il pass^3 sul flusso di lavoro verifica se l'agente ha scelto l'azione giusta e ha richiamato correttamente i suoi strumenti. Usa due segnali che Cekura chiama Expected Outcome e Mock Tool Accuracy.

Il pass^3 end-to-end rigoroso aggiunge una seconda domanda: il chiamante è arrivato davvero in fondo all'attività? Conteggia gli errori di infrastruttura, come l'agente che si blocca a metà chiamata, che impediscono al chiamante di concludere anche quando l'azione prevista era corretta.

Retell ha ottenuto il 95,7% in entrambi i casi, quindi non ha perso terreno a causa di problemi di runtime. Alcune piattaforme sì. Synthflow ha superato 16 valutatori su 23 per accuratezza nel flusso di lavoro, ma solo 2 su 23 con la valutazione rigorosa, perché durante l'uso degli strumenti i chiamanti restavano spesso in lunghi silenzi senza alcun segnale che l'agente stesse ancora lavorando.

Perché l'accuratezza del flusso di lavoro conta nelle chiamate Medicare

In una chiamata di vendita Medicare, l'agente non risponde soltanto alle domande. Deve fornire l'informativa obbligatoria, ottenere il consenso prima di parlare dei piani, evitare di dare consigli personalizzati e indirizzare il chiamante a un operatore umano autorizzato al momento giusto.

Questi passaggi sono stabiliti dalle norme federali sulle TPMO, e saltarne uno è un problema di conformità, non un'imperfezione.

È proprio questo che hanno sondato i 23 valutatori. Un chiamante interrompe l'informativa e pretende i dettagli del piano. Un familiare chiama a nome di un beneficiario. Un chiamante chiede all'agente di garantire che un piano copra il suo farmaco. In ogni caso la mossa corretta è specifica, e una piattaforma che si blocca o improvvisa fa fallire insieme il chiamante e la documentazione di conformità.

Il benchmark dimostra che usare lo stesso agente non basta. È la piattaforma sottostante a decidere se quell'agente tiene nelle chiamate a più alto rischio.

Dove si colloca Retell

Retell è una piattaforma per creare, testare, distribuire e monitorare agenti vocali con IA che effettuano e ricevono telefonate. Il benchmark ha premiato due aspetti su cui Retell è costruita: seguire un flusso di lavoro in più passaggi e richiamare correttamente gli strumenti sotto pressione.

  • Trasferimento assistito a un operatore umano autorizzato: quando il chiamante ha bisogno di una persona, l'agente passa la conversazione con il contesto già raccolto, tramite il trasferimento di chiamata.

  • Risposte da una knowledge base, non consigli fuori copione: l'agente recupera risposte concrete da una knowledge base collegata e resta entro ciò che gli è consentito dire.

  • Ogni chiamata rivista a posteriori: i team usano l'analisi post-chiamata e il controllo qualità con IA per vedere dove un flusso ha tenuto e dove ha vacillato.

  • Pensata per i settori regolamentati: Retell gestisce agenti vocali per team nella sanità e nelle assicurazioni, dove l'ordine delle operazioni in una chiamata non è opzionale.

Si tratta di un singolo test indipendente su un singolo flusso di lavoro, e i risultati variano in base a come un agente viene costruito e mantenuto. Ciò nonostante, in un'attività difficile e regolamentata, Retell si è messa davanti a tutte le altre.

Domande frequenti

Che cos'è un benchmark di IA vocale?

Un benchmark di IA vocale è un test controllato che esegue la stessa attività su piattaforme di agenti vocali diverse e valuta quanto bene ciascuna la gestisce. La versione di Cekura usa chiamate ripetute e valutatori fissi affinché il confronto resti equo.

Chi ha condotto questo benchmark?

Cekura, un'azienda indipendente che sviluppa strumenti di valutazione per agenti vocali. Retell non ha condotto il test né si è valutata da sola.

Che cosa significa pass^3?

Una piattaforma doveva superare un valutatore in tre esecuzioni separate per ottenere il punto. Una singola esecuzione fortunata non conta, il che rende il punteggio una prova di costanza e non di una sola buona chiamata.

Tutte le piattaforme hanno eseguito lo stesso agente?

Sì. Cekura ha distribuito un agente Medicare identico byte per byte su tutte e sei le piattaforme, con lo stesso prompt, gli stessi strumenti e la stessa voce, così qualsiasi differenza di punteggio dipende dalla piattaforma, non dall'agente.

Dove posso vedere i risultati completi?

Cekura pubblica le esecuzioni per singola piattaforma e la metodologia completa sulla propria pagina del benchmark, incluso il dettaglio di ogni valutatore dell'esperimento Medicare.

Crea un agente vocale che tiene anche nelle chiamate difficili.

Retell ti permette di creare, testare e lanciare un agente vocale con IA, per poi osservare come si comporta in ogni chiamata. Prova Retell gratis oppure contatta il team vendite.

ROI Calculator
Estimate Your ROI from Automating Calls

See how much your business could save by switching to AI-powered voice agents.

All done! 
Your submission has been sent to your email
Oops! Something went wrong while submitting the form.
   1
   8
20
Oops! Something went wrong while submitting the form.

ROI Result

2,000

Total Human Agent Cost

$5,000
/month

AI Agent Cost

$3,000
/month

Estimated Savings

$2,000
/month
Demo dal vivo
Prova la nostra demo dal vivo

Un numero di telefono demo di Retell Clinic Office

Grazie! Il tuo modulo è stato ricevuto!
Ops! Qualcosa è andato storto durante l'invio del modulo.

Read Other Blogs

Revolutionize your call operation with Retell