Introduktion af vCX-Hard, en Retell-benchmark, der rangerer førende modeller på rigtige kontaktcenteropkald og måler to egenskaber, der afgør, om en voice agent har succes: at forblive forankret i sandheden og tage den rigtige handling. vCX-Hard er bygget på proprietære produktionsopkaldsdata og evaluerer modellens ydeevne, hvor det betyder mest. Selv den bedste model i dag klarer kun omkring 88 % af de sværeste ture, hvilket netop er grunden til, at modelvalget er vigtigt.
Kunderne stiller os ét spørgsmål mere end noget andet: hvilken model skal jeg bruge til min stemmeagent? I lang tid var det ærlige interne svar et navn og et skuldertræk. For en platform, der kører millioner af rigtige kundeopkald, er det ikke godt nok.
En callcentermedarbejder lever eller dør på to evner, og kun to:
Offentlige benchmarks tester sjældent begge dele på én gang, og næsten aldrig under forholdene i et live telefonopkald. De data, der kan, er svære at få fat i. En enkelt virksomheds egne opkaldslogge er ikke mangfoldige nok til at rangere modeller med sikkerhed. Retell bruger reel, forskelligartet produktionstrafik på tværs af mange brancher og implementeringer, i den mængde, det kræver at adskille én model fra en anden. Det er den ene ingrediens, et pålideligt callcenter-benchmark har brug for, og det er den, de fleste teams ikke kan sammensætte.
Navnet siger, hvad det er. Det lille v står for stemme. CX står for kundeoplevelse, det daglige arbejde for en callcentermedarbejder. Metoden er hård: Vi bedømmer kun på de sværeste punkter i den reelle produktionstrafik, de øjeblikke, hvor modeller rent faktisk trækker fra hinanden. På den fulde fordeling af produktionsopkald klarer de fleste frontiermodeller allerede 90 procent, hvilket ikke fortæller dig noget brugbart. Den hårde del er, hvor en benchmark tjener sin plads.
Hver case udvindes fra rigtige produktionskald, ikke skrevet i hånden eller genereret syntetisk. Vi scorer modeller på de to akser, der bestemmer et kald:
Vi evaluerede 50 konfigurationer fordelt på 27 modeller. Fordi stemmeagenter i produktion kører med ræsonnement slået fra, rapporterer vi to visninger for latenstid: produktion (ræsonnement slået fra, hvad der kører på liveopkald) og bedste (medium ræsonnement, et loft for, hvor meget ræsonnement ville købe). GPT-5.5 fører begge og når 84,8 procent ikke-hallucinationer i produktion og 88,0 procent på sit bedste. Ingen model er i nærheden af løst, hvilket netop er pointen.
Vi undersøgte produktionsopkaldstrafikken mellem 6. februar og 1. maj 2026 i 30-minutters vinduer cirka hver 15. dag, hentet fra organisationer med mere end 1.000 opkald i de foregående tre måneder. Afgørende er det, at vi undersøgte stikprøverne på organisationsniveau, så nogle få organisationer med stor volumen ikke dominerer sættet. Det er det, der holder fordelingen bred på tværs af reelle implementeringer i stedet for skæv mod en enkelt kunde.
Ud fra den trafik udvalgte vi to sæt vanskelige cases: et hallucinationssæt på 2.075 cases og et værktøjskaldssæt på 1.514 cases. Hver case udvindes gennem en flertrins pipeline. Letvægtspræklassifikatorer markerer kandidattrin (numeriske krav, øjeblikke før overførsel, værktøjsfejl, gentagne eller manglende kald), en LLM-klassifikator bekræfter derefter, om der er opstået en reel fejl, og mærker dens kategori og alvorlighed, en anden gennemgang kontrollerer den specifikke trinning igen, og endelig genereres en korrekt referenceløsning til karaktergivning.
Selve taksonomien for fiaskoer er informativ. På hallucinationssiden er det dominerende problem ikke eksotisk. Agenter fabrikerer eller fejlagtigt formulerer politikker langt mere end noget andet.

Fejl i forbindelse med værktøjskald klumper sig lige så tæt op. Ud af 1.514 tilfælde er de to største kategorier manglende nødvendige kald ( 897 ) og udløsning af unødvendige kald ( 520 ). Forkert værktøjsvalg er næsten ikke-eksisterende (2 tilfælde). Med andre ord vælger modeller sjældent det forkerte værktøj. De fejler i vurderingen: at vide, hvornår de skal handle, og hvornår de skal vente.
Bedømmelsen sker ved hjælp af et LLM-råd: et panel af førende frontlinjemodeller, der bedømmer hver case ud fra en beskrivende rubrik og en genereret referenceløsning. Brugen af flere stærke dommere i stedet for én forhindrer, at evalueringen arver en enkelt models blinde vinkler, og uenigheder forliges inden for panelet.
Fordi absolutte scorer ændrer sig med rubrikken og dommerne, behandler vi rangeringen, ikke det nøjagtige tal, som signalet.
Den højeste score er omkring 88 procent, og det er med vilje. Hvis vi vurderede på den fulde produktionsfordeling, ville næsten alle frontiermodeller lande over 90 procent, og ranglisten ville ikke fortælle dig noget. Nemme beslutninger er nemme for alle.
Så vCX-Hard er bygget ud fra de sværeste drejninger, de øjeblikke hvor modeller rent faktisk afviger. Sådan fungerer enhver seriøs benchmark. En matematisk benchmark bruger konkurrenceproblemer, ikke den aritmetik, en typisk bruger indtaster. Målet er ikke et flatterende tal. Målet er et tal, du kan sammenligne på tværs af modeller og over tid, efterhånden som nye modeller kommer.
Vi viser hver rangliste på to måder: i produktion, hvor ræsonnement er slået fra, hvilket er det, der kører ved live-opkald, og bedst hver model ved sin stærkeste ræsonnementindstilling, hvilket viser loftet. Ved ikke-hallucinationer fører GPT-5.5 begge. I produktion ligger GPT-5-serien og gemini-3.1-pro i toppen; når ræsonnement er slået til, løftes de samme navne med et par point og jagten ændres bag dem.

Det er i værktøjsopkaldets korrekthed, at de to synspunkter adskiller sig mest. Med ræsonnement aktiveret fører GPT-5.5. Men i produktion, hvor det rent faktisk kører, falder GPT-5.5's værktøjsopkald fra 88,3 til 75,6 procent, og gemini-3.1-pro bliver den bedste værktøjsopkalder med en klar margin og holder 85,7 procent med ræsonnement off. Hvis din agent kører ræsonnement off, er den stærkeste model ikke den samme.

Tre mønstre skiller sig ud på tværs af hele sættet.
1. Ræsonnement er forskellen mellem de to synspunkter. At aktivere ræsonnement øger scoren på næsten alle modeller med omkring 5 point i gennemsnit for ikke-hallucinationer. GPT-5.5 stiger fra 84,8 til 88,0 procent, når den ræsonnerer, før den taler. Omkostningerne er latenstid, hvilket er grunden til, at de fleste produktionsagenter udelader det, og hvorfor produktionssynspunktet er det, man skal planlægge omkring.

2. Jordforbindelse og handling er forskellige færdigheder. De to akser rangerer ikke ens. En model, der er stærk på jordforbindelse, kan være middelmådig på værktøjskald og omvendt. GPT-5.4 rangerer nær toppen på jordforbindelse, men uden for top ti på værktøjskald, mens claude-4.5-sonnet er det modsatte. Valg af model er i virkeligheden et spørgsmål om, hvilken fejl dine kunder har mindst råd til.
3. Ingen model er sikker endnu. Selv når den er bedst, misser lederen stadig omkring en ud af otte af de sværeste drejninger på hver akse, og i produktion misser den flere. Forskellen mellem en benchmarkscore og en implementering, du kan stole på, er præcis det arbejde, platformen udfører oven på modellen.
Ser man på tværs af modelgenerationer, bevæger grænsen sig i den rigtige retning. Fra GPT-4o til GPT-5.5 steg ikke-hallucinationer fra 72,8 til 88,0 procent, med værktøjsopkald, der forbedredes i en lignende retning.

Produktion (ræsonnement, hvad der kører live) og bedst (stærkeste ræsonnementsindstilling) for hver model, sorteret efter produktion uden hallucinationer. Højere jo bedre.
| Model | Ikke-hallucinationer % | Værktøjsopkald % | ||
|---|---|---|---|---|
| Prod (ræsonnement af) | Bedst (med begrundelse) | Prod (ræsonnement af) | Bedst (med begrundelse) | |
| gpt-5.5 | 84,8% | 88,0% | 75,6% | 88,3% |
| gpt-5.4 | 83,0% | 83,3% | 75,2% | 77,4% |
| Gemini-3.1-pro | 82,6% | 83,6% | 85,7% | 85,9% |
| gpt-5.2 | 81,3% | 81,6% | 79,6% | 81,5% |
| claude-4.6-sonet | 81,2% | 81,6% | 80,1% | 80,4% |
| glm-5.1 | 79,3% | 82,7% | 77,3% | 83,8% |
| gpt-5.1 | 75,7% | 81,0% | 78,2% | 83,7% |
| Gemini 3.1 Flash Lite | 74,4% | 77,7% | 69,0% | 75,8% |
| Gemini-3-flash | 73,8% | 80,1% | 71,2% | 81,8% |
| gpt-4o | 72,8% | 72,8% | 63,6% | 63,6% |
| claude-4.5-haiku | 72,4% | 78,7% | 70,7% | 79,4% |
| Gemini-2.5-Pro | 72,3% | 77,2% | 72,9% | 80,6% |
| Gemini-3,5-blitz | 72,0% | 80,7% | 69,2% | 84,0% |
| claude-4.5-sonet | 71,5% | 80,6% | 77,5% | 85,8% |
| gpt-4.1 | 71,5% | 71,5% | 62,2% | 62,2% |
| gpt-5 | 71,2% | 78,8% | 68,9% | 83,2% |
| gpt-5.4-mini | 70,7% | 71,3% | 57,1% | 60,2% |
| gpt-5-mini | 69,4% | 75,2% | 70,6% | 75,6% |
| o4-mini | 67,9% | 67,9% | 73,9% | 73,9% |
| gpt-5.4-nano | 66,2% | 66,3% | 57,5% | 59,1% |
| grok-4.3 | 65,8% | 76,3% | 54,6% | 72,1% |
| kimi-k2.6 | 63,5% | 63,5% | 66,3% | 66,3% |
| o3-mini | 62,7% | 62,7% | 59,0% | 59,0% |
| Gemini 2.5 Flash Lite | 59,8% | 75,2% | 47,0% | 70,3% |
| kviksølv-2 | 56,7% | 61,9% | 52,2% | 55,9% |
| gpt-5-nano | 53,9% | 57,6% | 54,5% | 56,1% |
| deepseek-v4-pro | 49,8% | 55,6% | 58,9% | 64,5% |
Prod er hver model med ræsonnement slået fra, eller dens lavest tilgængelige indstilling. Best er dens stærkeste ræsonnementsindstilling. Modeller med matchende kolonner (gpt-4o, gpt-4.1, kimi-k2.6, o4-mini, o3-mini) fik evalueret en enkelt indstilling.
Et benchmark er kun nyttigt, hvis det ændrer den måde, du bygger på. Gaps vCX-Hard eksponerer kortet direkte på funktioner i Retell-platformen, så du ikke behøver at levere dem.
Modelvalg er trin et. Platformen omkring modellen er det, der forvandler en benchmarkscore til en implementering, du kan stole på.
vCX-Hard er en tidlig version og har reelle begrænsninger. Bedømmelsen afhænger af et LLM-bedømmerpanel, som har sine egne bias. Sagerne er vurderet efter sværhedsgrad, så scorerne afspejler de sværeste ture snarere end den gennemsnitlige opkaldskvalitet. Og benchmarken måler to specifikke fejltilstande, ikke den fulde oplevelse af et opkald, såsom tone, latenstid eller afbrydelseshåndtering.
Vi holder vCX-Hard opdateret, efterhånden som nye modeller lanceres. Hver lancering rejser det samme spørgsmål hos alle teams, der kører voice agents: en ny model er ude, skal vi skifte? vCX-Hard er bygget til at besvare det med aktuelle data snarere end et gæt.
Benchmarks er ikke til for at få tal til at se gode ud. De er til ærlig sammenligning. Når et mål er mættet, bygger feltet et sværere. vCX-Hard er den måde, vi vælger modeller internt på, og den måde, vi nu besvarer det spørgsmål, kunderne rent faktisk stiller, med beviser i stedet for et brandnavn. Vi vil fortsætte med at hæve barren, ligesom modellerne gør.
See how much your business could save by switching to AI-powered voice agents.
Total Human Agent Cost
AI Agent Cost
Estimated Savings
Et demonummer fra Retell Clinic Office

Start building smarter conversations today.




.avif)