vCX-Hard: benchmark dei principali modelli di IA su chiamate reali di contact center

vCX-Hard: benchmark dei principali modelli di IA su chiamate reali di contact center
BACK TO BLOGS
ON THIS PAGE
Back to top

Presentiamo vCX-Hard, un benchmark di Retell che classifica i principali modelli su chiamate reali di contact center, misurando due capacità che determinano se un agente vocale ha successo: rimanere ancorato alla verità e compiere l'azione giusta. Costruito a partire da dati proprietari di chiamate in produzione, vCX-Hard valuta le prestazioni dei modelli dove conta di più. Anche il miglior modello di oggi supera solo circa l'88% sui turni più difficili, ed è esattamente per questo che la scelta del modello è importante.

Perché lo abbiamo costruito

I clienti ci pongono una domanda più di ogni altra: quale modello dovrei usare per il mio agente vocale? Per molto tempo la risposta interna onesta era un nome e un'alzata di spalle. Per una piattaforma che gestisce milioni di chiamate reali dei clienti, questo non è abbastanza.

Un agente di call center vive o muore su due capacità, e solo due:

  • Rimanere ancorato. Rispondere in base alle politiche e alla conoscenza reali dell'azienda. Non inventare mai una tariffa, una regola o una promessa.
  • Agire correttamente. Chiamare lo strumento giusto, con gli argomenti giusti, al momento giusto. Non saltare un passaggio necessario e non compiere un'azione che nessuno ha richiesto.

I benchmark pubblici raramente testano entrambe le cose contemporaneamente, e quasi mai nelle condizioni di una chiamata telefonica dal vivo. I dati che possono farlo sono difficili da ottenere. I registri delle chiamate di una singola azienda non sono abbastanza diversificati da classificare i modelli con sicurezza. Retell dispone di traffico di produzione reale e diversificato in molti settori e distribuzioni, al volume necessario per distinguere un modello dall'altro. Questo è l'unico ingrediente di cui ha bisogno un benchmark affidabile per i call center, ed è quello che la maggior parte dei team non riesce ad assemblare.

Presentiamo vCX-Hard

Il nome dice cos'è. La v minuscola sta per voice (voce). CX è customer experience, il lavoro quotidiano di un agente di call center. Hard è il metodo: valutiamo solo i turni più difficili del traffico di produzione reale, i momenti in cui i modelli si distinguono davvero. Sull'intera distribuzione delle chiamate di produzione, la maggior parte dei modelli di frontiera supera già il 90 percento, il che non ti dice nulla di utile. La fetta difficile è dove un benchmark si guadagna il suo valore.

Ogni caso è estratto da chiamate di produzione reali, non scritto a mano o generato in modo sintetico. Valutiamo i modelli sui due assi che decidono una chiamata:

  • Tasso di non allucinazione. Quanto in modo affidabile l'agente rimane ancorato e rifiuta di inventare le cose.
  • Tasso di correttezza nella chiamata degli strumenti. Quanto in modo affidabile l'agente seleziona ed esegue le azioni giuste.

Abbiamo valutato 50 configurazioni che coprono 27 modelli. Poiché gli agenti vocali in produzione girano con il ragionamento disattivato, per la latenza, riportiamo due viste in tutto il documento: produzione (ragionamento disattivato, ciò che gira sulle chiamate dal vivo) e migliore (ragionamento medio, un tetto per quanto potrebbe rendere il ragionamento). GPT-5.5 è in testa a entrambe, raggiungendo l'84,8 percento di non allucinazione in produzione e l'88,0 percento al suo massimo. Nessun modello è vicino a risolvere il problema, che è esattamente il punto.

Come abbiamo costruito il dataset

Abbiamo campionato il traffico di chiamate di produzione tra il 6 febbraio e il 1° maggio 2026, in finestre di 30 minuti circa ogni 15 giorni, estratte da organizzazioni con più di 1.000 chiamate nei tre mesi precedenti. Fondamentale, abbiamo campionato a livello di organizzazione, così che poche organizzazioni ad alto volume non dominassero il set. È questo che mantiene la distribuzione ampia tra le distribuzioni reali anziché sbilanciata verso un singolo cliente.

Da quel traffico abbiamo curato due set di casi difficili: un set di allucinazioni di 2.075 casi e un set di chiamata degli strumenti di 1.514 casi. Ogni caso è estratto attraverso una pipeline a più fasi. Pre-classificatori leggeri segnalano i turni candidati (affermazioni numeriche, momenti pre-trasferimento, errori degli strumenti, chiamate ripetute o mancanti), un classificatore LLM conferma poi se si è verificato un vero fallimento e ne etichetta la categoria e la gravità, un secondo passaggio ricontrolla il turno specifico e infine viene generata una soluzione di riferimento corretta per la valutazione.

La tassonomia dei fallimenti stessa è informativa. Sul lato delle allucinazioni, il problema dominante non è esotico. Gli agenti fabbricano o riportano in modo errato le politiche molto più di qualsiasi altra cosa.

__wf_reserved_inherit
Figura 1. Categorie di allucinazioni su 2.075 casi curati. Fonte: Retell-Eval.

I fallimenti nella chiamata degli strumenti si raggruppano in modo altrettanto stretto. Su 1.514 casi, le due categorie più grandi sono l'omissione di una chiamata necessaria (897) e l'attivazione di una non necessaria (520). La selezione dello strumento sbagliato è quasi inesistente (2 casi). In altre parole, i modelli raramente scelgono lo strumento sbagliato. Falliscono nel giudizio: sapere quando agire e quando trattenersi.

Come valutiamo

La valutazione utilizza un consiglio di LLM: un panel di modelli di frontiera leader che assegna un punteggio a ogni caso rispetto a una rubrica descrittiva e a una soluzione di riferimento generata. L'uso di diversi giudici forti anziché di uno solo evita che la valutazione erediti i punti ciechi di un singolo modello, e i disaccordi vengono riconciliati all'interno del panel.

Poiché i punteggi assoluti variano con la rubrica e i giudici, trattiamo la classifica, non il numero esatto, come il segnale.

Perché valutiamo sui turni più difficili

Il punteggio più alto è di circa l'88 percento, e questo è voluto. Se valutassimo sull'intera distribuzione di produzione, quasi ogni modello di frontiera si attesterebbe sopra il 90 percento e la classifica non ti direbbe nulla. Le chiamate facili sono facili per tutti.

Quindi vCX-Hard è costruito a partire dai turni più difficili, i momenti in cui i modelli divergono davvero. È così che funziona ogni benchmark serio. Un benchmark di matematica usa problemi da competizione, non l'aritmetica che un utente tipico digita. L'obiettivo non è un numero lusinghiero. L'obiettivo è un numero che puoi confrontare tra i modelli, e nel tempo man mano che escono nuovi modelli.

Risultati

Mostriamo ogni classifica in due modi: produzione, con il ragionamento disattivato, che è ciò che gira sulle chiamate dal vivo, e migliore, ogni modello alla sua impostazione di ragionamento più forte, che mostra il tetto. Sulla non allucinazione, GPT-5.5 è in testa a entrambe. In produzione la linea GPT-5 e gemini-3.1-pro si posizionano in cima; attivare il ragionamento solleva gli stessi nomi di qualche punto e rimescola l'inseguimento dietro di loro.

__wf_reserved_inherit
Figura 2. Tasso di non allucinazione, i primi 12 modelli. Produzione rispetto a migliore.

La correttezza nella chiamata degli strumenti è dove le due viste divergono di più. Con il ragionamento attivato, GPT-5.5 è in testa. Ma in produzione, dove gira effettivamente, la chiamata degli strumenti di GPT-5.5 cala dall'88,3 al 75,6 percento, e gemini-3.1-pro diventa il miglior chiamante di strumenti con un margine netto, mantenendo l'85,7 percento con il ragionamento disattivato. Se il tuo agente gira con il ragionamento disattivato, il modello più forte non è lo stesso.

__wf_reserved_inherit
Figura 3. Correttezza nella chiamata degli strumenti, i primi 12 modelli. Produzione rispetto a migliore.

Tre pattern spiccano sull'intero set.

1. Il ragionamento è il divario tra le due viste. Attivare il ragionamento solleva i punteggi su quasi ogni modello, di circa 5 punti in media per la non allucinazione. GPT-5.5 sale dall'84,8 all'88,0 percento una volta che ragiona prima di parlare. Il costo è la latenza, motivo per cui la maggior parte degli agenti di produzione lo lascia disattivato, e perché la vista di produzione è quella su cui pianificare.

__wf_reserved_inherit
Figura 4. Ragionamento disattivato rispetto a medio, tasso di non allucinazione.

2. Ancoraggio e azione sono capacità diverse. I due assi non si classificano allo stesso modo. Un modello forte sull'ancoraggio può essere mediocre sulla chiamata degli strumenti e viceversa. GPT-5.4 si classifica vicino alla cima sull'ancoraggio ma fuori dai primi dieci sulla chiamata degli strumenti, mentre claude-4.5-sonnet è l'opposto. Scegliere un modello è in realtà una questione di quale fallimento i tuoi clienti possono meno permettersi.

3. Nessun modello è ancora sicuro. Anche al suo massimo il leader manca ancora circa uno su otto dei turni più difficili su ciascun asse, e in produzione ne manca di più. Il divario tra un punteggio di benchmark e una distribuzione di cui puoi fidarti è esattamente il lavoro che la piattaforma fa sopra il modello.

Guardando attraverso le generazioni di modelli, la frontiera si sta muovendo nella direzione giusta. Da GPT-4o a GPT-5.5, la non allucinazione è salita dal 72,8 all'88,0 percento, con la chiamata degli strumenti che migliora su un arco simile.

__wf_reserved_inherit
Figura 5. Generazioni di modelli OpenAI su vCX-Hard, migliore impostazione standard.

Classifica completa

Produzione (ragionamento disattivato, ciò che gira dal vivo) e migliore (impostazione di ragionamento più forte) per ogni modello, ordinati per non allucinazione in produzione. Più alto è meglio.

ModelloNon allucinazione %Chiamata strumenti %
Prod (ragionamento off)Migliore (con ragionamento)Prod (ragionamento off)Migliore (con ragionamento)
gpt-5.584,8%88,0%75,6%88,3%
gpt-5.483,0%83,3%75,2%77,4%
gemini-3.1-pro82,6%83,6%85,7%85,9%
gpt-5.281,3%81,6%79,6%81,5%
claude-4.6-sonnet81,2%81,6%80,1%80,4%
glm-5.179,3%82,7%77,3%83,8%
gpt-5.175,7%81,0%78,2%83,7%
gemini-3.1-flash-lite74,4%77,7%69,0%75,8%
gemini-3-flash73,8%80,1%71,2%81,8%
gpt-4o72,8%72,8%63,6%63,6%
claude-4.5-haiku72,4%78,7%70,7%79,4%
gemini-2.5-pro72,3%77,2%72,9%80,6%
gemini-3.5-flash72,0%80,7%69,2%84,0%
claude-4.5-sonnet71,5%80,6%77,5%85,8%
gpt-4.171,5%71,5%62,2%62,2%
gpt-571,2%78,8%68,9%83,2%
gpt-5.4-mini70,7%71,3%57,1%60,2%
gpt-5-mini69,4%75,2%70,6%75,6%
o4-mini67,9%67,9%73,9%73,9%
gpt-5.4-nano66,2%66,3%57,5%59,1%
grok-4.365,8%76,3%54,6%72,1%
kimi-k2.663,5%63,5%66,3%66,3%
o3-mini62,7%62,7%59,0%59,0%
gemini-2.5-flash-lite59,8%75,2%47,0%70,3%
mercury-256,7%61,9%52,2%55,9%
gpt-5-nano53,9%57,6%54,5%56,1%
deepseek-v4-pro49,8%55,6%58,9%64,5%

Prod è ogni modello con il ragionamento disattivato, o la sua impostazione disponibile più bassa. Migliore è la sua impostazione di ragionamento più forte. I modelli con colonne corrispondenti (gpt-4o, gpt-4.1, kimi-k2.6, o4-mini, o3-mini) sono stati valutati con una singola impostazione.

Dai risultati alla produzione

Un benchmark è utile solo se cambia il modo in cui costruisci. I divari che vCX-Hard espone si mappano direttamente sulle funzionalità della piattaforma Retell, così non devi svilupparle tu.

  • LLM per nodo: nessun modello vince ovunque. Ancoraggio e azione sono capacità diverse, e il miglior modello su un turno difficile è eccessivo su uno facile. L'LLM per nodo ti permette di instradare ogni passaggio di una conversazione al modello giusto: il tuo modello più forte sui turni più difficili e ad alto rischio, uno più veloce ed economico sui saluti e le conferme. Paghi per l'accuratezza di alto livello solo dove conta.
  • Parla mentre aspetti: le chiamate degli strumenti richiedono tempo. Quando un agente deve interrogare un'API o cercare qualcosa a metà chiamata, quel viaggio di andata e ritorno può lasciare silenzio sulla linea. Parla mentre aspetti mantiene il chiamante coinvolto con un parlato naturale mentre la chiamata dello strumento è in corso, così la pausa non sembra mai che la linea sia caduta nel silenzio.
  • Ancoraggio alla knowledge base: il fallimento più comune di tutti. La fabbricazione di politiche e le citazioni errate dalla knowledge base sono le due categorie più grandi di allucinazioni nel benchmark. Ancorare l'agente alla tua knowledge base mantiene le risposte legate alle tue politiche reali invece che alla migliore ipotesi del modello.
  • Test di simulazione: i casi che questo benchmark non può vedere. vCX-Hard gira sul nostro traffico di produzione. Le tue chiamate più difficili sono le tue. Il test di simulazione ti permette di eseguire lo stesso tipo di valutazione sui tuoi scenari, così puoi scegliere e ottimizzare un modello rispetto alle chiamate che ricevi effettivamente.
  • QA con IA: il benchmark valuta i modelli, il QA con IA valuta le tue chiamate. vCX-Hard gira su un set fisso; la tua produzione continua a cambiare. Il QA con IA valuta continuamente un campione delle tue chiamate dal vivo sugli stessi assi che contano qui, allucinazione, recupero dalla knowledge base e accuratezza nella chiamata degli strumenti, oltre a metriche personalizzate che definisci per ciò che conta come una buona chiamata.

La scelta del modello è il primo passo. La piattaforma attorno al modello è ciò che trasforma un punteggio di benchmark in una distribuzione di cui puoi fidarti.

Limiti e cosa viene dopo

vCX-Hard è una versione iniziale e ha limiti reali. La valutazione si basa su un panel di giudici LLM, che porta con sé i propri bias. I casi sono estratti per difficoltà, quindi i punteggi riflettono i turni più difficili anziché la qualità media delle chiamate. E il benchmark misura due modalità di fallimento specifiche, non l'esperienza completa di una chiamata come tono, latenza o gestione delle interruzioni.

Continueremo ad aggiornare vCX-Hard man mano che escono nuovi modelli. Ogni lancio scatena la stessa domanda in ogni team che gestisce agenti vocali: è uscito un nuovo modello, passiamo ad esso? vCX-Hard è costruito per rispondere a questa domanda con dati attuali anziché con una supposizione.

Perché lo stiamo condividendo

I benchmark non servono a far apparire belli i numeri. Servono per un confronto onesto. Quando uno si satura, il settore ne costruisce uno più difficile. vCX-Hard è il modo in cui scegliamo i modelli internamente, e il modo in cui ora rispondiamo alla domanda che i clienti pongono davvero, con prove invece che con un nome di marca. Continueremo ad alzare l'asticella man mano che lo fanno i modelli.

ROI Calculator
Estimate Your ROI from Automating Calls

See how much your business could save by switching to AI-powered voice agents.

All done! 
Your submission has been sent to your email
Oops! Something went wrong while submitting the form.
   1
   8
20
Oops! Something went wrong while submitting the form.

ROI Result

2,000

Total Human Agent Cost

$5,000
/month

AI Agent Cost

$3,000
/month

Estimated Savings

$2,000
/month
Demo dal vivo
Prova la nostra demo dal vivo

Un numero di telefono demo di Retell Clinic Office

Grazie! Il tuo modulo è stato ricevuto!
Ops! Qualcosa è andato storto durante l'invio del modulo.

Read Other Blogs

Revolutionize your call operation with Retell