Παρουσιάζουμε το vCX-Hard, ένα σημείο αναφοράς Retell που κατατάσσει κορυφαία μοντέλα σε πραγματικές κλήσεις σε τηλεφωνικό κέντρο, μετρώντας δύο δυνατότητες που καθορίζουν εάν ένας φωνητικός πράκτορας επιτυγχάνει: να παραμένει προσγειωμένος στην αλήθεια και να αναλαμβάνει τη σωστή δράση. Κατασκευασμένο από ιδιόκτητα δεδομένα κλήσεων παραγωγής, το vCX-Hard αξιολογεί την απόδοση του μοντέλου εκεί που έχει μεγαλύτερη σημασία. Ακόμα και το καλύτερο μοντέλο σήμερα ξεπερνά μόνο το 88% στις πιο δύσκολες στροφές, γι' αυτό και η επιλογή μοντέλου έχει σημασία.
Οι πελάτες μας κάνουν μία ερώτηση περισσότερο από οποιαδήποτε άλλη: ποιο μοντέλο πρέπει να χρησιμοποιήσω για τον φωνητικό μου εκπρόσωπο; Για πολύ καιρό η ειλικρινής εσωτερική απάντηση ήταν ένα όνομα και ένα αδιάφορο σχόλιο. Για μια πλατφόρμα που εκτελεί εκατομμύρια πραγματικές κλήσεις πελατών, αυτό δεν είναι αρκετό.
Ένας υπάλληλος τηλεφωνικού κέντρου ζει ή πεθαίνει με δύο ικανότητες, και μόνο δύο:
Τα δημόσια benchmarks σπάνια δοκιμάζουν και τα δύο ταυτόχρονα και σχεδόν ποτέ υπό τις συνθήκες μιας ζωντανής τηλεφωνικής κλήσης. Τα δεδομένα που μπορούν να συλλεχθούν είναι δύσκολο να συγκεντρωθούν. Τα αρχεία καταγραφής κλήσεων μιας μεμονωμένης εταιρείας δεν είναι αρκετά ποικίλα για να κατατάξουν τα μοντέλα με σιγουριά. Το Retell βασίζεται σε πραγματική, ποικίλη κίνηση παραγωγής σε πολλούς κλάδους και εφαρμογές, στον όγκο που απαιτείται για να διαχωρίσει ένα μοντέλο από ένα άλλο. Αυτό είναι το ένα συστατικό που χρειάζεται ένα αξιόπιστο benchmark τηλεφωνικού κέντρου και είναι αυτό που οι περισσότερες ομάδες δεν μπορούν να συγκεντρώσουν.
Το όνομα λέει τι είναι. Το πεζό v σημαίνει φωνή. Η εμπειρία πελατών είναι η εμπειρία πελατών, η καθημερινή εργασία ενός εκπροσώπου τηλεφωνικού κέντρου. Δύσκολη είναι η μέθοδος: βαθμολογούμε μόνο τις πιο δύσκολες στροφές από την πραγματική κίνηση παραγωγής, τις στιγμές όπου τα μοντέλα πραγματικά αποσυνδέονται. Στην πλήρη κατανομή των κλήσεων παραγωγής, τα περισσότερα μοντέλα frontier ήδη ξεπερνούν το 90%, κάτι που δεν σας λέει τίποτα χρήσιμο. Το δύσκολο κομμάτι είναι εκεί που ένα benchmark κερδίζει την αξία του.
Κάθε περίπτωση εξάγεται από πραγματικές κλήσεις παραγωγής, όχι γραμμένες χειρόγραφα ή δημιουργημένες συνθετικά. Βαθμολογούμε μοντέλα με βάση τους δύο άξονες που καθορίζουν μια κλήση:
Αξιολογήσαμε 50 διαμορφώσεις που καλύπτουν 27 μοντέλα. Επειδή οι φωνητικοί πράκτορες στην παραγωγή εκτελούνται με συλλογιστική απενεργοποιημένη, για την καθυστέρηση, αναφέρουμε δύο προβολές σε όλη την παραγωγή (συλλογική απενεργοποιημένη, τι εκτελείται σε ζωντανές κλήσεις) και βέλτιστη (μέτρια συλλογιστική, ένα ανώτατο όριο για το πόσο συλλογιστική θα αγόραζε). Το GPT-5.5 ηγείται και των δύο, φτάνοντας το 84,8% μη ψευδαισθήσεων στην παραγωγή και το 88,0% στην καλύτερη περίπτωση. Κανένα μοντέλο δεν είναι κοντά στο να λυθεί, το οποίο είναι ακριβώς το θέμα.
Λάβαμε δείγματα από την κίνηση κλήσεων παραγωγής μεταξύ 6 Φεβρουαρίου και 1ης Μαΐου 2026, σε διαστήματα 30 λεπτών περίπου κάθε 15 ημέρες, από οργανισμούς με περισσότερες από 1.000 κλήσεις τους προηγούμενους τρεις μήνες. Το πιο σημαντικό είναι ότι λάβαμε δείγματα σε επίπεδο οργανισμού, έτσι ώστε να μην κυριαρχούν λίγοι οργανισμοί μεγάλου όγκου. Αυτό διατηρεί την κατανομή ευρεία σε πραγματικές αναπτύξεις και όχι στρεβλωμένη προς οποιονδήποτε πελάτη.
Από αυτήν την κίνηση επιλέξαμε δύο σύνολα δύσκολων περιπτώσεων: ένα σύνολο ψευδαισθήσεων 2.075 περιπτώσεων και ένα σύνολο κλήσης εργαλείων 1.514 περιπτώσεων. Κάθε περίπτωση εξορύσσεται μέσω μιας αγωγού πολλαπλών σταδίων. Οι ελαφριοί προ-ταξινομητές επισημαίνουν τις υποψήφιες στροφές (αριθμητικές αξιώσεις, ροπές προ-μεταφοράς, σφάλματα εργαλείων, επαναλαμβανόμενες ή ελλείπουσες κλήσεις), ένας ταξινομητής LLM επιβεβαιώνει στη συνέχεια εάν υπήρξε πραγματική αστοχία και επισημαίνει την κατηγορία και τη σοβαρότητά της, ένα δεύτερο πέρασμα επανελέγχει τη συγκεκριμένη στροφή και τέλος δημιουργείται μια σωστή λύση αναφοράς για την ταξινόμηση.
Η ίδια η ταξινόμηση της αποτυχίας είναι κατατοπιστική. Από την πλευρά των παραισθήσεων, το κυρίαρχο πρόβλημα δεν είναι εξωτικό. Οι πράκτορες κατασκευάζουν ή διατυπώνουν εσφαλμένα πολιτικές πολύ περισσότερο από οτιδήποτε άλλο.

Οι αποτυχίες στην κλήση εργαλείων συγκεντρώνονται εξίσου στενά. Από τις 1.514 περιπτώσεις, οι δύο μεγαλύτερες κατηγορίες είναι η μη λήψη μιας απαραίτητης κλήσης ( 897 ) και η ενεργοποίηση μιας περιττής ( 520 ). Η επιλογή λανθασμένου εργαλείου είναι σχεδόν ανύπαρκτη (2 περιπτώσεις). Με άλλα λόγια, τα μοντέλα σπάνια επιλέγουν το λάθος εργαλείο. Αποτυγχάνουν στην κρίση τους: στο να γνωρίζουν πότε να δράσουν και πότε να περιμένουν.
Η βαθμολόγηση χρησιμοποιεί ένα συμβούλιο LLM: μια ομάδα κορυφαίων μοντέλων αιχμής που βαθμολογεί κάθε περίπτωση με βάση μια περιγραφική ρουμπρίκα και μια παραγόμενη λύση αναφοράς. Η χρήση πολλών ισχυρών κριτών αντί για έναν εμποδίζει την αξιολόγηση να κληρονομήσει τα τυφλά σημεία οποιουδήποτε μεμονωμένου μοντέλου και οι διαφωνίες διευθετούνται εντός της ομάδας.
Επειδή οι απόλυτες βαθμολογίες αλλάζουν με την αξιολόγηση και τους κριτές, θεωρούμε την κατάταξη και όχι τον ακριβή αριθμό ως το σήμα.
Η κορυφαία βαθμολογία είναι περίπου 88%, και αυτό οφείλεται σε κάποιο συγκεκριμένο σκοπό. Αν αξιολογούσαμε με βάση την πλήρη κατανομή παραγωγής, σχεδόν κάθε μοντέλο Frontier θα έφτανε πάνω από 90% και ο πίνακας κατάταξης δεν θα σας έλεγε τίποτα. Οι εύκολες αποφάσεις είναι εύκολες για όλους.
Έτσι, το vCX-Hard βασίζεται στις πιο δύσκολες στροφές, τις στιγμές όπου τα μοντέλα αποκλίνουν στην πραγματικότητα. Έτσι λειτουργεί κάθε σοβαρό benchmark. Ένα μαθηματικό benchmark χρησιμοποιεί προβλήματα ανταγωνισμού, όχι την αριθμητική που πληκτρολογεί ένας τυπικός χρήστης. Ο στόχος δεν είναι ένας κολακευτικός αριθμός. Ο στόχος είναι ένας αριθμός που μπορείτε να συγκρίνετε μεταξύ μοντέλων και σε βάθος χρόνου καθώς κυκλοφορούν νέα μοντέλα.
Δείχνουμε κάθε πίνακα κατάταξης με δύο τρόπους: την παραγωγή, με απενεργοποιημένη τη συλλογιστική, η οποία είναι αυτή που εκτελείται στις ζωντανές κλήσεις, και, στην καλύτερη περίπτωση, κάθε μοντέλο στην ισχυρότερη ρύθμιση συλλογιστικής του, η οποία δείχνει το ανώτατο όριο. Όσον αφορά τη μη ψευδαίσθηση, το GPT-5.5 προηγείται και των δύο. Στην παραγωγή, η σειρά GPT-5 και το gemini-3.1-pro βρίσκονται στην κορυφή. Η ενεργοποίηση της συλλογιστικής ανεβάζει τα ίδια ονόματα σε μερικούς βαθμούς και αναδιατάσσει την καταδίωξη πίσω τους.

Η ορθότητα της κλήσης εργαλείων είναι το σημείο όπου οι δύο απόψεις αποκλίνουν περισσότερο. Με τη συλλογιστική σε εξέλιξη, το GPT-5.5 προηγείται. Αλλά στην παραγωγή, όπου και λειτουργεί στην πραγματικότητα, η κλήση εργαλείων του GPT-5.5 μειώνεται από 88,3% σε 75,6%, και το gemini-3.1-pro γίνεται το καλύτερο εργαλείο κλήσης με σαφή διαφορά, διατηρώντας το 85,7% με τη συλλογιστική εκτός. Εάν ο πράκτοράς σας εκτελεί συλλογιστική εκτός, το ισχυρότερο μοντέλο δεν είναι το ίδιο.

Τρία μοτίβα ξεχωρίζουν σε όλο το σετ.
1. Η συλλογιστική είναι το χάσμα μεταξύ των δύο απόψεων. Η μετατροπή της συλλογιστικής σε κάτι άλλο αυξάνει τις βαθμολογίες σε σχεδόν κάθε μοντέλο, κατά περίπου 5 μονάδες κατά μέσο όρο για τη μη ψευδαίσθηση. Το GPT-5.5 ανεβαίνει από 84,8 σε 88,0 τοις εκατό μόλις συλλογιστεί πριν μιλήσει. Το κόστος είναι η καθυστέρηση, γι' αυτό και οι περισσότεροι εκπρόσωποι παραγωγής την παραλείπουν, και γι' αυτό η οπτική της παραγωγής είναι αυτή γύρω από την οποία πρέπει να σχεδιάζεται.

2. Η γείωση και η δράση είναι διαφορετικές δεξιότητες. Οι δύο άξονες δεν κατατάσσονται το ίδιο. Ένα μοντέλο με ισχυρή γείωση μπορεί να είναι μέτριο στην κλήση εργαλείων και το αντίστροφο. Το GPT-5.4 κατατάσσεται κοντά στην κορυφή στη γείωση, αλλά εκτός της δεκάδας στην κλήση εργαλείων, ενώ το claude-4.5-sonnet είναι το αντίθετο. Η επιλογή ενός μοντέλου είναι στην πραγματικότητα ένα ζήτημα για το ποια αποτυχία μπορούν λιγότερο να αντέξουν οι πελάτες σας.
3. Κανένα μοντέλο δεν είναι ακόμα ασφαλές. Ακόμα και στην καλύτερη του κατάσταση, ο κορυφαίος εξακολουθεί να χάνει περίπου μία στις οκτώ από τις πιο δύσκολες στροφές σε κάθε άξονα, και στην παραγωγή χάνει περισσότερες. Το χάσμα μεταξύ μιας βαθμολογίας benchmark και μιας αξιόπιστης ανάπτυξης είναι ακριβώς η δουλειά που κάνει η πλατφόρμα πάνω στο μοντέλο.
Εξετάζοντας τις γενιές των μοντέλων, το μέτωπο κινείται προς τη σωστή κατεύθυνση. Από το GPT-4o στο GPT-5.5, η μη ψευδαίσθηση αυξήθηκε από 72,8% σε 88,0%, με την κλήση εργαλείων να βελτιώνεται σε παρόμοιο τόξο.

Παραγωγή (λογική απόκλιση, τι εκτελείται ζωντανά) και βέλτιστη (ισχυρότερη ρύθμιση συλλογισμού) για κάθε μοντέλο, ταξινομημένη κατά παραγωγή χωρίς ψευδαισθήσεις. Όσο υψηλότερη είναι, τόσο καλύτερη.
| Μοντέλο | Μη ψευδαισθήσεις % | % Κλήσης Εργαλείου | ||
|---|---|---|---|---|
| Παραγωγή (λογική απόκλιση) | Καλύτερο (με συλλογισμό) | Παραγωγή (λογική απόκλιση) | Καλύτερο (με συλλογισμό) | |
| gpt-5.5 | 84,8% | 88,0% | 75,6% | 88,3% |
| gpt-5.4 | 83,0% | 83,3% | 75,2% | 77,4% |
| gemini-3.1-pro | 82,6% | 83,6% | 85,7% | 85,9% |
| gpt-5.2 | 81,3% | 81,6% | 79,6% | 81,5% |
| claude-4.6-σονέτο | 81,2% | 81,6% | 80,1% | 80,4% |
| glm-5.1 | 79,3% | 82,7% | 77,3% | 83,8% |
| gpt-5.1 | 75,7% | 81,0% | 78,2% | 83,7% |
| gemini-3.1-flash-lite | 74,4% | 77,7% | 69,0% | 75,8% |
| gemini-3-flash | 73,8% | 80,1% | 71,2% | 81,8% |
| gpt-4o | 72,8% | 72,8% | 63,6% | 63,6% |
| claude-4.5-haiku | 72,4% | 78,7% | 70,7% | 79,4% |
| gemini-2.5-pro | 72,3% | 77,2% | 72,9% | 80,6% |
| gemini-3.5-flash | 72,0% | 80,7% | 69,2% | 84,0% |
| claude-4.5-σονέτο | 71,5% | 80,6% | 77,5% | 85,8% |
| gpt-4.1 | 71,5% | 71,5% | 62,2% | 62,2% |
| gpt-5 | 71,2% | 78,8% | 68,9% | 83,2% |
| gpt-5.4-mini | 70,7% | 71,3% | 57,1% | 60,2% |
| gpt-5-mini | 69,4% | 75,2% | 70,6% | 75,6% |
| o4-mini | 67,9% | 67,9% | 73,9% | 73,9% |
| gpt-5.4-nano | 66,2% | 66,3% | 57,5% | 59,1% |
| grok-4.3 | 65,8% | 76,3% | 54,6% | 72,1% |
| kimi-k2.6 | 63,5% | 63,5% | 66,3% | 66,3% |
| o3-mini | 62,7% | 62,7% | 59,0% | 59,0% |
| gemini-2.5-flash-lite | 59,8% | 75,2% | 47,0% | 70,3% |
| υδράργυρος-2 | 56,7% | 61,9% | 52,2% | 55,9% |
| gpt-5-nano | 53,9% | 57,6% | 54,5% | 56,1% |
| deepseek-v4-pro | 49,8% | 55,6% | 58,9% | 64,5% |
Το Prod είναι κάθε μοντέλο με συλλογιστική απενεργοποιημένη ή τη χαμηλότερη διαθέσιμη ρύθμιση. Το Best είναι η ισχυρότερη ρύθμιση συλλογισμού του. Στα μοντέλα με αντίστοιχες στήλες (gpt-4o, gpt-4.1, kimi-k2.6, o4-mini, o3-mini) αξιολογήθηκε μία μόνο ρύθμιση.
Ένα benchmark είναι χρήσιμο μόνο αν αλλάζει τον τρόπο κατασκευής. Τα κενά vCX-Hard εκθέτουν τον χάρτη απευθείας σε λειτουργίες στην πλατφόρμα Retell, επομένως δεν χρειάζεται να τα αποστείλετε.
Η επιλογή μοντέλου είναι το πρώτο βήμα. Η πλατφόρμα γύρω από το μοντέλο είναι αυτή που μετατρέπει μια βαθμολογία αναφοράς σε μια αξιόπιστη ανάπτυξη.
Το vCX-Hard είναι μια πρώιμη έκδοση και έχει πραγματικά όρια. Η βαθμολογία βασίζεται σε μια επιτροπή κριτών LLM, η οποία έχει τις δικές της προκαταλήψεις. Οι περιπτώσεις εξορύσσονται με βάση τη δυσκολία, επομένως οι βαθμολογίες αντικατοπτρίζουν τις πιο δύσκολες στροφές και όχι τη μέση ποιότητα κλήσης. Και το benchmark μετρά δύο συγκεκριμένους τρόπους αποτυχίας, όχι την πλήρη εμπειρία μιας κλήσης, όπως ο τόνος, η καθυστέρηση ή ο χειρισμός διακοπών.
Θα ενημερώνουμε συνεχώς το vCX-Hard καθώς κυκλοφορούν νέα μοντέλα. Κάθε κυκλοφορία θέτει το ίδιο ερώτημα σε κάθε ομάδα που διαχειρίζεται φωνητικούς πράκτορες: κυκλοφορεί ένα νέο μοντέλο, μπορούμε να αλλάξουμε; Το vCX-Hard έχει σχεδιαστεί για να απαντά σε αυτό με βάση τα τρέχοντα δεδομένα και όχι με μια εικασία.
Τα benchmarks δεν χρησιμεύουν για να κάνουν τους αριθμούς να φαίνονται καλοί. Είναι για ειλικρινή σύγκριση. Όταν κάποιος κορεσθεί, το πεδίο δημιουργεί ένα πιο δύσκολο. Το vCX-Hard είναι ο τρόπος με τον οποίο επιλέγουμε μοντέλα εσωτερικά και πώς απαντάμε πλέον στην ερώτηση που πραγματικά θέτουν οι πελάτες, με στοιχεία αντί για ένα εμπορικό σήμα. Θα συνεχίσουμε να ανεβάζουμε τον πήχη όπως κάνουν και τα μοντέλα.
See how much your business could save by switching to AI-powered voice agents.
Total Human Agent Cost
AI Agent Cost
Estimated Savings
Ένας αριθμός τηλεφώνου Demo από το Retell Clinic Office

Start building smarter conversations today.




.avif)