Voice AI Benchmark: Η Retell στη #1 θέση για ακρίβεια ροής εργασίας Medicare


Ένα νέο benchmark φωνητικού AI πήρε έναν πράκτορα ασφαλίσεων Medicare, τον έβαλε σε έξι διαφορετικές πλατφόρμες χωρίς να αλλάξει ούτε μία γραμμή και μέτρησε ποια ακολούθησε πραγματικά τη ροή εργασίας. Η Retell τερμάτισε πρώτη.
Το τεστ προήλθε από την Cekura, μια ανεξάρτητη εταιρεία που κατασκευάζει εργαλεία αξιολόγησης για φωνητικούς πράκτορες. Το πείραμά της με το Medicare εκτέλεσε συνολικά 414 κλήσεις και βαθμολόγησε κάθε πλατφόρμα ως προς το πόσο αξιόπιστα διαχειρίστηκε μια ρυθμιζόμενη ασφαλιστική συνομιλία.
Η Retell προηγήθηκε με 95,7% ακρίβεια ροής εργασίας, περνώντας 22 από τους 23 ελέγχους. Όλες οι υπόλοιπες πλατφόρμες κινήθηκαν μεταξύ 65,2% και 95,7%, παρότι όλες εκτελούσαν τον πανομοιότυπο πράκτορα.
TL;DR
Η Cekura ανέπτυξε έναν πράκτορα Medicare πανομοιότυπο σε επίπεδο byte σε έξι φωνητικές πλατφόρμες και εκτέλεσε 414 κλήσεις.
Η Retell κατέκτησε τη #1 θέση με 95,7% ακρίβεια ροής εργασίας, περνώντας 22 από τους 23 evaluators.
Οι βαθμολογίες κινήθηκαν από 65,2% έως 95,7%, άρα τη διαφορά την έκανε η πλατφόρμα, όχι ο πράκτορας.
Η Retell κράτησε την πρώτη θέση και με αυστηρή end-to-end βαθμολόγηση, που προσμετρά τις αστοχίες κατά την εκτέλεση, ξανά με 95,7%.
Σε μια ρυθμιζόμενη κλήση Medicare, αυτή η διαφορά είναι η διαφορά μεταξύ μιας συμμορφούμενης μεταβίβασης και μιας χαμένης ή μη συμμορφούμενης.
Η Cekura έφτιαξε έναν πράκτορα TPMO για Medicare και ανέπτυξε ένα πανομοιότυπο σε επίπεδο byte αντίγραφο σε κάθε μία από τις έξι πλατφόρμες. Ίδιο prompt, ίδια εργαλεία, ίδια φωνή. Η μόνη μεταβλητή ήταν η πλατφόρμα που έτρεχε από κάτω.
TPMO είναι ένας οργανισμός μάρκετινγκ τρίτου μέρους, το είδος του αδειοδοτημένου πρακτορείου που πουλά προγράμματα Medicare Advantage και Part D. Αυτές οι κλήσεις είναι αυστηρά ρυθμιζόμενες, οπότε ο πράκτορας πρέπει να κάνει πολλά σωστά, και με καθορισμένη σειρά.
Το benchmark χρησιμοποίησε 23 evaluators, ο καθένας εστιασμένος σε ένα σημείο όπου οι ασφαλιστικές κλήσεις συνήθως σπάνε. Χωρίζονταν σε τέσσερις ομάδες: έναρξη της κλήσης και λήψη άδειας, κατανόηση του τι πραγματικά χρειάζεται ο καλών, αξιολόγηση και καταγραφή του lead, και παραμονή μέσα στα όρια προστασίας του καταναλωτή.
Κάθε evaluator εκτελέστηκε τρεις φορές σε κάθε πλατφόρμα, και μια πλατφόρμα κέρδιζε βαθμό μόνο αν περνούσαν και οι τρεις εκτελέσεις, ένα μέτρο που η Cekura ονομάζει pass^3. Είκοσι τρεις evaluators, τρεις εκτελέσεις ο καθένας, σε έξι πλατφόρμες, βγάζουν συνολικά τις 414 κλήσεις. Μπορείτε να διαβάσετε τη μεθοδολογία και τις εκτελέσεις ανά πλατφόρμα στη σελίδα benchmark της Cekura.
Δείτε πώς βαθμολογήθηκαν οι έξι πλατφόρμες, με σειρά ακρίβειας ροής εργασίας:
| Πλατφόρμα | Ροή εργασίας pass^3 | Αυστηρό end-to-end pass^3 |
|---|---|---|
| Retell | 95,7% (22/23) | 95,7% (22/23) |
| ElevenLabs | 91,3% (21/23) | 91,3% (21/23) |
| Pipecat | 82,6% (19/23) | 73,9% (17/23) |
| LiveKit | 73,9% (17/23) | 73,9% (17/23) |
| Synthflow | 69,6% (16/23) | 8,7% (2/23) |
| Vapi | 65,2% (15/23) | 65,2% (15/23) |
Η Retell ήταν η μόνη πλατφόρμα που ξεπέρασε το 95% σε ακρίβεια ροής εργασίας, και διατήρησε αυτή τη βαθμολογία και με το αυστηρότερο μέτρο που εξηγείται παρακάτω.
Η Cekura ανέφερε δύο βαθμολογίες, επειδή ένας φωνητικός πράκτορας μπορεί να αποτύχει με δύο διαφορετικούς τρόπους.
Το pass^3 ροής εργασίας εξετάζει αν ο πράκτορας επέλεξε τη σωστή ενέργεια και κάλεσε σωστά τα εργαλεία του. Χρησιμοποιεί δύο δείκτες που η Cekura ονομάζει Expected Outcome και Mock Tool Accuracy.
Το αυστηρό end-to-end pass^3 προσθέτει ένα δεύτερο ερώτημα: κατάφερε πράγματι ο καλών να ολοκληρώσει το ζητούμενο; Προσμετρά αστοχίες υποδομής, όπως το να «κολλήσει» ο πράκτορας στη μέση της κλήσης, που εμποδίζουν τον καλούντα να ολοκληρώσει, ακόμη κι όταν η προβλεπόμενη ενέργεια ήταν σωστή.
Η Retell σημείωσε 95,7% και στα δύο, άρα δεν έχασε έδαφος από προβλήματα κατά την εκτέλεση. Άλλες πλατφόρμες έχασαν. Η Synthflow πέρασε 16 από τους 23 evaluators σε ακρίβεια ροής εργασίας, αλλά μόνο 2 από τους 23 στην αυστηρή βαθμολόγηση, επειδή κατά τη χρήση εργαλείων οι καλούντες συχνά περίμεναν σε μεγάλες σιωπές χωρίς κάποια ένδειξη ότι ο πράκτορας δούλευε ακόμη.
Σε μια κλήση πώλησης Medicare, ο πράκτορας δεν απαντά απλώς σε ερωτήσεις. Πρέπει να παραδώσει την απαιτούμενη γνωστοποίηση, να λάβει συναίνεση πριν συζητήσει προγράμματα, να αποφύγει την παροχή εξατομικευμένων συμβουλών και να δρομολογήσει τον καλούντα σε αδειοδοτημένο άνθρωπο τη σωστή στιγμή.
Αυτά τα βήματα καθορίζονται από τους ομοσπονδιακούς κανόνες TPMO, και η παράλειψη ενός από αυτά είναι ζήτημα συμμόρφωσης, όχι μια μικρή ατέλεια.
Αυτό εξέτασαν οι 23 evaluators. Ένας καλών διακόπτει τη γνωστοποίηση και απαιτεί λεπτομέρειες προγράμματος. Ένα μέλος της οικογένειας καλεί εκ μέρους ενός δικαιούχου. Ένας καλών ζητά από τον πράκτορα να υποσχεθεί ότι ένα πρόγραμμα καλύπτει το φάρμακό του. Η σωστή κίνηση σε κάθε περίπτωση είναι συγκεκριμένη, και μια πλατφόρμα που κολλάει ή αυτοσχεδιάζει αποτυγχάνει ταυτόχρονα απέναντι στον καλούντα και στο αρχείο συμμόρφωσης.
Το benchmark δείχνει ότι δεν αρκεί να τρέχει κανείς τον ίδιο πράκτορα. Η πλατφόρμα από κάτω κρίνει αν αυτός ο πράκτορας θα ανταποκριθεί στις κλήσεις με το μεγαλύτερο ρίσκο.
Η Retell είναι μια πλατφόρμα για τη δημιουργία, δοκιμή, ανάπτυξη και παρακολούθηση φωνητικών πρακτόρων AI που πραγματοποιούν και δέχονται τηλεφωνικές κλήσεις. Το benchmark επιβράβευσε δύο πράγματα γύρω από τα οποία είναι χτισμένη η Retell: την τήρηση μιας ροής εργασίας πολλών βημάτων και τη σωστή κλήση εργαλείων υπό πίεση.
Θερμή μεταβίβαση σε αδειοδοτημένο άνθρωπο: όταν ένας καλών χρειάζεται άνθρωπο, ο πράκτορας κάνει τη μεταβίβαση με το πλαίσιο που έχει ήδη συγκεντρώσει, μέσω της μεταβίβασης κλήσης.
Απαντήσεις από βάση γνώσεων, όχι συμβουλές εκτός σεναρίου: ο πράκτορας αντλεί τεκμηριωμένες απαντήσεις από μια συνδεδεμένη βάση γνώσεων και παραμένει μέσα σε ό,τι επιτρέπεται να πει.
Κάθε κλήση εξετάζεται εκ των υστέρων: οι ομάδες χρησιμοποιούν την ανάλυση μετά την κλήση και το AI QA για να δουν πού η ροή στάθηκε και πού γλίστρησε.
Φτιαγμένη για ρυθμιζόμενους κλάδους: η Retell τρέχει φωνητικούς πράκτορες για ομάδες στην υγειονομική περίθαλψη και στις ασφάλειες, όπου η σειρά των ενεργειών σε μια κλήση δεν είναι προαιρετική.
Πρόκειται για ένα ανεξάρτητο τεστ σε μία ροή εργασίας, και τα αποτελέσματα διαφέρουν ανάλογα με τον τρόπο που κατασκευάζεται και συντηρείται ένας πράκτορας. Παρ' όλα αυτά, σε ένα δύσκολο, ρυθμιζόμενο έργο, η Retell βγήκε μπροστά από όλες.
Ένα benchmark φωνητικού AI είναι ένα ελεγχόμενο τεστ που εκτελεί το ίδιο έργο σε διαφορετικές πλατφόρμες φωνητικών πρακτόρων και βαθμολογεί πόσο καλά το διαχειρίζεται η καθεμία. Η εκδοχή της Cekura χρησιμοποιεί επαναλαμβανόμενες κλήσεις και σταθερούς evaluators, ώστε η σύγκριση να παραμένει δίκαιη.
Η Cekura, μια ανεξάρτητη εταιρεία που κατασκευάζει εργαλεία αξιολόγησης για φωνητικούς πράκτορες. Η Retell δεν εκτέλεσε το τεστ ούτε βαθμολόγησε τον εαυτό της.
Μια πλατφόρμα έπρεπε να περάσει έναν evaluator σε τρεις ξεχωριστές εκτελέσεις για να πάρει βαθμό. Μια τυχερή εκτέλεση δεν μετράει, κάτι που κάνει τη βαθμολογία τεστ συνέπειας και όχι μιας μεμονωμένης καλής κλήσης.
Ναι. Η Cekura ανέπτυξε έναν πανομοιότυπο σε επίπεδο byte πράκτορα Medicare σε όλες τις έξι πλατφόρμες, με το ίδιο prompt, τα ίδια εργαλεία και την ίδια φωνή, ώστε κάθε διαφορά στη βαθμολογία να προέρχεται από την πλατφόρμα και όχι από τον πράκτορα.
Η Cekura δημοσιεύει τις εκτελέσεις ανά πλατφόρμα και την πλήρη μεθοδολογία στη σελίδα benchmark της, μαζί με ανάλυση κάθε evaluator στο πείραμα Medicare.
Δημιουργήστε έναν φωνητικό πράκτορα που ανταποκρίνεται στις δύσκολες κλήσεις.
Η Retell σας επιτρέπει να δημιουργήσετε, να δοκιμάσετε και να λανσάρετε έναν φωνητικό πράκτορα AI, και μετά να παρακολουθείτε την απόδοσή του σε κάθε κλήση. Δοκιμάστε δωρεάν τη Retell ή μιλήστε με τις πωλήσεις.
See how much your business could save by switching to AI-powered voice agents.
Total Human Agent Cost
AI Agent Cost
Estimated Savings
Ένας αριθμός τηλεφώνου Demo από το Retell Clinic Office

Start building smarter conversations today.

