Presentiamo vCX-Hard, un benchmark di Retell che classifica i principali modelli su chiamate reali di contact center, misurando due capacità che determinano se un agente vocale ha successo: rimanere ancorato alla verità e compiere l'azione giusta. Costruito a partire da dati proprietari di chiamate in produzione, vCX-Hard valuta le prestazioni dei modelli dove conta di più. Anche il miglior modello di oggi supera solo circa l'88% sui turni più difficili, ed è esattamente per questo che la scelta del modello è importante.
I clienti ci pongono una domanda più di ogni altra: quale modello dovrei usare per il mio agente vocale? Per molto tempo la risposta interna onesta era un nome e un'alzata di spalle. Per una piattaforma che gestisce milioni di chiamate reali dei clienti, questo non è abbastanza.
Un agente di call center vive o muore su due capacità, e solo due:
I benchmark pubblici raramente testano entrambe le cose contemporaneamente, e quasi mai nelle condizioni di una chiamata telefonica dal vivo. I dati che possono farlo sono difficili da ottenere. I registri delle chiamate di una singola azienda non sono abbastanza diversificati da classificare i modelli con sicurezza. Retell dispone di traffico di produzione reale e diversificato in molti settori e distribuzioni, al volume necessario per distinguere un modello dall'altro. Questo è l'unico ingrediente di cui ha bisogno un benchmark affidabile per i call center, ed è quello che la maggior parte dei team non riesce ad assemblare.
Il nome dice cos'è. La v minuscola sta per voice (voce). CX è customer experience, il lavoro quotidiano di un agente di call center. Hard è il metodo: valutiamo solo i turni più difficili del traffico di produzione reale, i momenti in cui i modelli si distinguono davvero. Sull'intera distribuzione delle chiamate di produzione, la maggior parte dei modelli di frontiera supera già il 90 percento, il che non ti dice nulla di utile. La fetta difficile è dove un benchmark si guadagna il suo valore.
Ogni caso è estratto da chiamate di produzione reali, non scritto a mano o generato in modo sintetico. Valutiamo i modelli sui due assi che decidono una chiamata:
Abbiamo valutato 50 configurazioni che coprono 27 modelli. Poiché gli agenti vocali in produzione girano con il ragionamento disattivato, per la latenza, riportiamo due viste in tutto il documento: produzione (ragionamento disattivato, ciò che gira sulle chiamate dal vivo) e migliore (ragionamento medio, un tetto per quanto potrebbe rendere il ragionamento). GPT-5.5 è in testa a entrambe, raggiungendo l'84,8 percento di non allucinazione in produzione e l'88,0 percento al suo massimo. Nessun modello è vicino a risolvere il problema, che è esattamente il punto.
Abbiamo campionato il traffico di chiamate di produzione tra il 6 febbraio e il 1° maggio 2026, in finestre di 30 minuti circa ogni 15 giorni, estratte da organizzazioni con più di 1.000 chiamate nei tre mesi precedenti. Fondamentale, abbiamo campionato a livello di organizzazione, così che poche organizzazioni ad alto volume non dominassero il set. È questo che mantiene la distribuzione ampia tra le distribuzioni reali anziché sbilanciata verso un singolo cliente.
Da quel traffico abbiamo curato due set di casi difficili: un set di allucinazioni di 2.075 casi e un set di chiamata degli strumenti di 1.514 casi. Ogni caso è estratto attraverso una pipeline a più fasi. Pre-classificatori leggeri segnalano i turni candidati (affermazioni numeriche, momenti pre-trasferimento, errori degli strumenti, chiamate ripetute o mancanti), un classificatore LLM conferma poi se si è verificato un vero fallimento e ne etichetta la categoria e la gravità, un secondo passaggio ricontrolla il turno specifico e infine viene generata una soluzione di riferimento corretta per la valutazione.
La tassonomia dei fallimenti stessa è informativa. Sul lato delle allucinazioni, il problema dominante non è esotico. Gli agenti fabbricano o riportano in modo errato le politiche molto più di qualsiasi altra cosa.

I fallimenti nella chiamata degli strumenti si raggruppano in modo altrettanto stretto. Su 1.514 casi, le due categorie più grandi sono l'omissione di una chiamata necessaria (897) e l'attivazione di una non necessaria (520). La selezione dello strumento sbagliato è quasi inesistente (2 casi). In altre parole, i modelli raramente scelgono lo strumento sbagliato. Falliscono nel giudizio: sapere quando agire e quando trattenersi.
La valutazione utilizza un consiglio di LLM: un panel di modelli di frontiera leader che assegna un punteggio a ogni caso rispetto a una rubrica descrittiva e a una soluzione di riferimento generata. L'uso di diversi giudici forti anziché di uno solo evita che la valutazione erediti i punti ciechi di un singolo modello, e i disaccordi vengono riconciliati all'interno del panel.
Poiché i punteggi assoluti variano con la rubrica e i giudici, trattiamo la classifica, non il numero esatto, come il segnale.
Il punteggio più alto è di circa l'88 percento, e questo è voluto. Se valutassimo sull'intera distribuzione di produzione, quasi ogni modello di frontiera si attesterebbe sopra il 90 percento e la classifica non ti direbbe nulla. Le chiamate facili sono facili per tutti.
Quindi vCX-Hard è costruito a partire dai turni più difficili, i momenti in cui i modelli divergono davvero. È così che funziona ogni benchmark serio. Un benchmark di matematica usa problemi da competizione, non l'aritmetica che un utente tipico digita. L'obiettivo non è un numero lusinghiero. L'obiettivo è un numero che puoi confrontare tra i modelli, e nel tempo man mano che escono nuovi modelli.
Mostriamo ogni classifica in due modi: produzione, con il ragionamento disattivato, che è ciò che gira sulle chiamate dal vivo, e migliore, ogni modello alla sua impostazione di ragionamento più forte, che mostra il tetto. Sulla non allucinazione, GPT-5.5 è in testa a entrambe. In produzione la linea GPT-5 e gemini-3.1-pro si posizionano in cima; attivare il ragionamento solleva gli stessi nomi di qualche punto e rimescola l'inseguimento dietro di loro.

La correttezza nella chiamata degli strumenti è dove le due viste divergono di più. Con il ragionamento attivato, GPT-5.5 è in testa. Ma in produzione, dove gira effettivamente, la chiamata degli strumenti di GPT-5.5 cala dall'88,3 al 75,6 percento, e gemini-3.1-pro diventa il miglior chiamante di strumenti con un margine netto, mantenendo l'85,7 percento con il ragionamento disattivato. Se il tuo agente gira con il ragionamento disattivato, il modello più forte non è lo stesso.

Tre pattern spiccano sull'intero set.
1. Il ragionamento è il divario tra le due viste. Attivare il ragionamento solleva i punteggi su quasi ogni modello, di circa 5 punti in media per la non allucinazione. GPT-5.5 sale dall'84,8 all'88,0 percento una volta che ragiona prima di parlare. Il costo è la latenza, motivo per cui la maggior parte degli agenti di produzione lo lascia disattivato, e perché la vista di produzione è quella su cui pianificare.

2. Ancoraggio e azione sono capacità diverse. I due assi non si classificano allo stesso modo. Un modello forte sull'ancoraggio può essere mediocre sulla chiamata degli strumenti e viceversa. GPT-5.4 si classifica vicino alla cima sull'ancoraggio ma fuori dai primi dieci sulla chiamata degli strumenti, mentre claude-4.5-sonnet è l'opposto. Scegliere un modello è in realtà una questione di quale fallimento i tuoi clienti possono meno permettersi.
3. Nessun modello è ancora sicuro. Anche al suo massimo il leader manca ancora circa uno su otto dei turni più difficili su ciascun asse, e in produzione ne manca di più. Il divario tra un punteggio di benchmark e una distribuzione di cui puoi fidarti è esattamente il lavoro che la piattaforma fa sopra il modello.
Guardando attraverso le generazioni di modelli, la frontiera si sta muovendo nella direzione giusta. Da GPT-4o a GPT-5.5, la non allucinazione è salita dal 72,8 all'88,0 percento, con la chiamata degli strumenti che migliora su un arco simile.

Produzione (ragionamento disattivato, ciò che gira dal vivo) e migliore (impostazione di ragionamento più forte) per ogni modello, ordinati per non allucinazione in produzione. Più alto è meglio.
| Modello | Non allucinazione % | Chiamata strumenti % | ||
|---|---|---|---|---|
| Prod (ragionamento off) | Migliore (con ragionamento) | Prod (ragionamento off) | Migliore (con ragionamento) | |
| gpt-5.5 | 84,8% | 88,0% | 75,6% | 88,3% |
| gpt-5.4 | 83,0% | 83,3% | 75,2% | 77,4% |
| gemini-3.1-pro | 82,6% | 83,6% | 85,7% | 85,9% |
| gpt-5.2 | 81,3% | 81,6% | 79,6% | 81,5% |
| claude-4.6-sonnet | 81,2% | 81,6% | 80,1% | 80,4% |
| glm-5.1 | 79,3% | 82,7% | 77,3% | 83,8% |
| gpt-5.1 | 75,7% | 81,0% | 78,2% | 83,7% |
| gemini-3.1-flash-lite | 74,4% | 77,7% | 69,0% | 75,8% |
| gemini-3-flash | 73,8% | 80,1% | 71,2% | 81,8% |
| gpt-4o | 72,8% | 72,8% | 63,6% | 63,6% |
| claude-4.5-haiku | 72,4% | 78,7% | 70,7% | 79,4% |
| gemini-2.5-pro | 72,3% | 77,2% | 72,9% | 80,6% |
| gemini-3.5-flash | 72,0% | 80,7% | 69,2% | 84,0% |
| claude-4.5-sonnet | 71,5% | 80,6% | 77,5% | 85,8% |
| gpt-4.1 | 71,5% | 71,5% | 62,2% | 62,2% |
| gpt-5 | 71,2% | 78,8% | 68,9% | 83,2% |
| gpt-5.4-mini | 70,7% | 71,3% | 57,1% | 60,2% |
| gpt-5-mini | 69,4% | 75,2% | 70,6% | 75,6% |
| o4-mini | 67,9% | 67,9% | 73,9% | 73,9% |
| gpt-5.4-nano | 66,2% | 66,3% | 57,5% | 59,1% |
| grok-4.3 | 65,8% | 76,3% | 54,6% | 72,1% |
| kimi-k2.6 | 63,5% | 63,5% | 66,3% | 66,3% |
| o3-mini | 62,7% | 62,7% | 59,0% | 59,0% |
| gemini-2.5-flash-lite | 59,8% | 75,2% | 47,0% | 70,3% |
| mercury-2 | 56,7% | 61,9% | 52,2% | 55,9% |
| gpt-5-nano | 53,9% | 57,6% | 54,5% | 56,1% |
| deepseek-v4-pro | 49,8% | 55,6% | 58,9% | 64,5% |
Prod è ogni modello con il ragionamento disattivato, o la sua impostazione disponibile più bassa. Migliore è la sua impostazione di ragionamento più forte. I modelli con colonne corrispondenti (gpt-4o, gpt-4.1, kimi-k2.6, o4-mini, o3-mini) sono stati valutati con una singola impostazione.
Un benchmark è utile solo se cambia il modo in cui costruisci. I divari che vCX-Hard espone si mappano direttamente sulle funzionalità della piattaforma Retell, così non devi svilupparle tu.
La scelta del modello è il primo passo. La piattaforma attorno al modello è ciò che trasforma un punteggio di benchmark in una distribuzione di cui puoi fidarti.
vCX-Hard è una versione iniziale e ha limiti reali. La valutazione si basa su un panel di giudici LLM, che porta con sé i propri bias. I casi sono estratti per difficoltà, quindi i punteggi riflettono i turni più difficili anziché la qualità media delle chiamate. E il benchmark misura due modalità di fallimento specifiche, non l'esperienza completa di una chiamata come tono, latenza o gestione delle interruzioni.
Continueremo ad aggiornare vCX-Hard man mano che escono nuovi modelli. Ogni lancio scatena la stessa domanda in ogni team che gestisce agenti vocali: è uscito un nuovo modello, passiamo ad esso? vCX-Hard è costruito per rispondere a questa domanda con dati attuali anziché con una supposizione.
I benchmark non servono a far apparire belli i numeri. Servono per un confronto onesto. Quando uno si satura, il settore ne costruisce uno più difficile. vCX-Hard è il modo in cui scegliamo i modelli internamente, e il modo in cui ora rispondiamo alla domanda che i clienti pongono davvero, con prove invece che con un nome di marca. Continueremo ad alzare l'asticella man mano che lo fanno i modelli.
See how much your business could save by switching to AI-powered voice agents.
Total Human Agent Cost
AI Agent Cost
Estimated Savings
Un numero di telefono demo di Retell Clinic Office

Start building smarter conversations today.




.avif)