vCX-Hard: Benchmarking af førende AI-modeller på rigtige kontaktcenteropkald

vCX-Hard: Benchmarking af førende AI-modeller på rigtige kontaktcenteropkald
BACK TO BLOGS
ON THIS PAGE
Back to top

Introduktion af vCX-Hard, en Retell-benchmark, der rangerer førende modeller på rigtige kontaktcenteropkald og måler to egenskaber, der afgør, om en voice agent har succes: at forblive forankret i sandheden og tage den rigtige handling. vCX-Hard er bygget på proprietære produktionsopkaldsdata og evaluerer modellens ydeevne, hvor det betyder mest. Selv den bedste model i dag klarer kun omkring 88 % af de sværeste ture, hvilket netop er grunden til, at modelvalget er vigtigt.

Hvorfor vi byggede dette

Kunderne stiller os ét spørgsmål mere end noget andet: hvilken model skal jeg bruge til min stemmeagent? I lang tid var det ærlige interne svar et navn og et skuldertræk. For en platform, der kører millioner af rigtige kundeopkald, er det ikke godt nok.

En callcentermedarbejder lever eller dør på to evner, og kun to:

  • Bevar din jordforbindelse. Svar ud fra virksomhedens faktiske politikker og viden. Opfind aldrig et gebyr, en regel eller et løfte.
  • Handl korrekt. Tilkald det rigtige værktøj med de rigtige argumenter på det rigtige tidspunkt. Spring ikke et nødvendigt trin over, og udfør ikke en handling, som ingen har bedt om.

Offentlige benchmarks tester sjældent begge dele på én gang, og næsten aldrig under forholdene i et live telefonopkald. De data, der kan, er svære at få fat i. En enkelt virksomheds egne opkaldslogge er ikke mangfoldige nok til at rangere modeller med sikkerhed. Retell bruger reel, forskelligartet produktionstrafik på tværs af mange brancher og implementeringer, i den mængde, det kræver at adskille én model fra en anden. Det er den ene ingrediens, et pålideligt callcenter-benchmark har brug for, og det er den, de fleste teams ikke kan sammensætte.

Introduktion af vCX-Hard

Navnet siger, hvad det er. Det lille v står for stemme. CX står for kundeoplevelse, det daglige arbejde for en callcentermedarbejder. Metoden er hård: Vi bedømmer kun på de sværeste punkter i den reelle produktionstrafik, de øjeblikke, hvor modeller rent faktisk trækker fra hinanden. På den fulde fordeling af produktionsopkald klarer de fleste frontiermodeller allerede 90 procent, hvilket ikke fortæller dig noget brugbart. Den hårde del er, hvor en benchmark tjener sin plads.

Hver case udvindes fra rigtige produktionskald, ikke skrevet i hånden eller genereret syntetisk. Vi scorer modeller på de to akser, der bestemmer et kald:

  • Ikke-hallucinationsrate. Hvor pålideligt agenten forbliver jordnær og nægter at opdigte ting.
  • Korrekthedsgrad for værktøjsopkald. Hvor pålideligt agenten vælger og udfører de rigtige handlinger.

Vi evaluerede 50 konfigurationer fordelt på 27 modeller. Fordi stemmeagenter i produktion kører med ræsonnement slået fra, rapporterer vi to visninger for latenstid: produktion (ræsonnement slået fra, hvad der kører på liveopkald) og bedste (medium ræsonnement, et loft for, hvor meget ræsonnement ville købe). GPT-5.5 fører begge og når 84,8 procent ikke-hallucinationer i produktion og 88,0 procent på sit bedste. Ingen model er i nærheden af løst, hvilket netop er pointen.

Sådan byggede vi datasættet

Vi undersøgte produktionsopkaldstrafikken mellem 6. februar og 1. maj 2026 i 30-minutters vinduer cirka hver 15. dag, hentet fra organisationer med mere end 1.000 opkald i de foregående tre måneder. Afgørende er det, at vi undersøgte stikprøverne på organisationsniveau, så nogle få organisationer med stor volumen ikke dominerer sættet. Det er det, der holder fordelingen bred på tværs af reelle implementeringer i stedet for skæv mod en enkelt kunde.

Ud fra den trafik udvalgte vi to sæt vanskelige cases: et hallucinationssæt på 2.075 cases og et værktøjskaldssæt på 1.514 cases. Hver case udvindes gennem en flertrins pipeline. Letvægtspræklassifikatorer markerer kandidattrin (numeriske krav, øjeblikke før overførsel, værktøjsfejl, gentagne eller manglende kald), en LLM-klassifikator bekræfter derefter, om der er opstået en reel fejl, og mærker dens kategori og alvorlighed, en anden gennemgang kontrollerer den specifikke trinning igen, og endelig genereres en korrekt referenceløsning til karaktergivning.

Selve taksonomien for fiaskoer er informativ. På hallucinationssiden er det dominerende problem ikke eksotisk. Agenter fabrikerer eller fejlagtigt formulerer politikker langt mere end noget andet.

__wf_reserved_inherit
Figur 1. Hallucinationskategorier på tværs af 2.075 kuraterede tilfælde. Kilde: Retell-Eval.

Fejl i forbindelse med værktøjskald klumper sig lige så tæt op. Ud af 1.514 tilfælde er de to største kategorier manglende nødvendige kald ( 897 ) og udløsning af unødvendige kald ( 520 ). Forkert værktøjsvalg er næsten ikke-eksisterende (2 tilfælde). Med andre ord vælger modeller sjældent det forkerte værktøj. De fejler i vurderingen: at vide, hvornår de skal handle, og hvornår de skal vente.

Sådan bedømmer vi

Bedømmelsen sker ved hjælp af et LLM-råd: et panel af førende frontlinjemodeller, der bedømmer hver case ud fra en beskrivende rubrik og en genereret referenceløsning. Brugen af flere stærke dommere i stedet for én forhindrer, at evalueringen arver en enkelt models blinde vinkler, og uenigheder forliges inden for panelet.

Fordi absolutte scorer ændrer sig med rubrikken og dommerne, behandler vi rangeringen, ikke det nøjagtige tal, som signalet.

Hvorfor vi karaktererer på de sværeste sving

Den højeste score er omkring 88 procent, og det er med vilje. Hvis vi vurderede på den fulde produktionsfordeling, ville næsten alle frontiermodeller lande over 90 procent, og ranglisten ville ikke fortælle dig noget. Nemme beslutninger er nemme for alle.

Så vCX-Hard er bygget ud fra de sværeste drejninger, de øjeblikke hvor modeller rent faktisk afviger. Sådan fungerer enhver seriøs benchmark. En matematisk benchmark bruger konkurrenceproblemer, ikke den aritmetik, en typisk bruger indtaster. Målet er ikke et flatterende tal. Målet er et tal, du kan sammenligne på tværs af modeller og over tid, efterhånden som nye modeller kommer.

Resultater

Vi viser hver rangliste på to måder: i produktion, hvor ræsonnement er slået fra, hvilket er det, der kører ved live-opkald, og bedst hver model ved sin stærkeste ræsonnementindstilling, hvilket viser loftet. Ved ikke-hallucinationer fører GPT-5.5 begge. I produktion ligger GPT-5-serien og gemini-3.1-pro i toppen; når ræsonnement er slået til, løftes de samme navne med et par point og jagten ændres bag dem.

__wf_reserved_inherit
Figur 2. Ikke-hallucinationsrate, top 12 modeller. Produktion versus bedste.

Det er i værktøjsopkaldets korrekthed, at de to synspunkter adskiller sig mest. Med ræsonnement aktiveret fører GPT-5.5. Men i produktion, hvor det rent faktisk kører, falder GPT-5.5's værktøjsopkald fra 88,3 til 75,6 procent, og gemini-3.1-pro bliver den bedste værktøjsopkalder med en klar margin og holder 85,7 procent med ræsonnement off. Hvis din agent kører ræsonnement off, er den stærkeste model ikke den samme.

__wf_reserved_inherit
Figur 3. Værktøjskaldkorrekthed, top 12 modeller. Produktion versus bedste.

Tre mønstre skiller sig ud på tværs af hele sættet.

1. Ræsonnement er forskellen mellem de to synspunkter. At aktivere ræsonnement øger scoren på næsten alle modeller med omkring 5 point i gennemsnit for ikke-hallucinationer. GPT-5.5 stiger fra 84,8 til 88,0 procent, når den ræsonnerer, før den taler. Omkostningerne er latenstid, hvilket er grunden til, at de fleste produktionsagenter udelader det, og hvorfor produktionssynspunktet er det, man skal planlægge omkring.

__wf_reserved_inherit
Figur 4. Ræsonnement uden hallucinationer versus middel, ikke-hallucinationsrate.

2. Jordforbindelse og handling er forskellige færdigheder. De to akser rangerer ikke ens. En model, der er stærk på jordforbindelse, kan være middelmådig på værktøjskald og omvendt. GPT-5.4 rangerer nær toppen på jordforbindelse, men uden for top ti på værktøjskald, mens claude-4.5-sonnet er det modsatte. Valg af model er i virkeligheden et spørgsmål om, hvilken fejl dine kunder har mindst råd til.

3. Ingen model er sikker endnu. Selv når den er bedst, misser lederen stadig omkring en ud af otte af de sværeste drejninger på hver akse, og i produktion misser den flere. Forskellen mellem en benchmarkscore og en implementering, du kan stole på, er præcis det arbejde, platformen udfører oven på modellen.

Ser man på tværs af modelgenerationer, bevæger grænsen sig i den rigtige retning. Fra GPT-4o til GPT-5.5 steg ikke-hallucinationer fra 72,8 til 88,0 procent, med værktøjsopkald, der forbedredes i en lignende retning.

__wf_reserved_inherit
Figur 5. OpenAI-modelgenereringer på vCX-Hard, bedste standardindstilling.

Fuld rangliste

Produktion (ræsonnement, hvad der kører live) og bedst (stærkeste ræsonnementsindstilling) for hver model, sorteret efter produktion uden hallucinationer. Højere jo bedre.

Model Ikke-hallucinationer % Værktøjsopkald %
Prod (ræsonnement af) Bedst (med begrundelse) Prod (ræsonnement af) Bedst (med begrundelse)
gpt-5.5 84,8% 88,0% 75,6% 88,3%
gpt-5.4 83,0% 83,3% 75,2% 77,4%
Gemini-3.1-pro 82,6% 83,6% 85,7% 85,9%
gpt-5.2 81,3% 81,6% 79,6% 81,5%
claude-4.6-sonet 81,2% 81,6% 80,1% 80,4%
glm-5.1 79,3% 82,7% 77,3% 83,8%
gpt-5.1 75,7% 81,0% 78,2% 83,7%
Gemini 3.1 Flash Lite 74,4% 77,7% 69,0% 75,8%
Gemini-3-flash 73,8% 80,1% 71,2% 81,8%
gpt-4o 72,8% 72,8% 63,6% 63,6%
claude-4.5-haiku 72,4% 78,7% 70,7% 79,4%
Gemini-2.5-Pro 72,3% 77,2% 72,9% 80,6%
Gemini-3,5-blitz 72,0% 80,7% 69,2% 84,0%
claude-4.5-sonet 71,5% 80,6% 77,5% 85,8%
gpt-4.1 71,5% 71,5% 62,2% 62,2%
gpt-5 71,2% 78,8% 68,9% 83,2%
gpt-5.4-mini 70,7% 71,3% 57,1% 60,2%
gpt-5-mini 69,4% 75,2% 70,6% 75,6%
o4-mini 67,9% 67,9% 73,9% 73,9%
gpt-5.4-nano 66,2% 66,3% 57,5% 59,1%
grok-4.3 65,8% 76,3% 54,6% 72,1%
kimi-k2.6 63,5% 63,5% 66,3% 66,3%
o3-mini 62,7% 62,7% 59,0% 59,0%
Gemini 2.5 Flash Lite 59,8% 75,2% 47,0% 70,3%
kviksølv-2 56,7% 61,9% 52,2% 55,9%
gpt-5-nano 53,9% 57,6% 54,5% 56,1%
deepseek-v4-pro 49,8% 55,6% 58,9% 64,5%

Prod er hver model med ræsonnement slået fra, eller dens lavest tilgængelige indstilling. Best er dens stærkeste ræsonnementsindstilling. Modeller med matchende kolonner (gpt-4o, gpt-4.1, kimi-k2.6, o4-mini, o3-mini) fik evalueret en enkelt indstilling.

Fra fund til produktion

Et benchmark er kun nyttigt, hvis det ændrer den måde, du bygger på. Gaps vCX-Hard eksponerer kortet direkte på funktioner i Retell-platformen, så du ikke behøver at levere dem.

  • Per-node LLM: ingen model vinder alle steder. Jordforbindelse og handling er forskellige færdigheder, og den bedste model på en svær tur er overkill på en nem. Per-node LLM giver dig mulighed for at dirigere hvert trin i en samtale til den rigtige model: din stærkeste model på de sværeste tur med højest indsats, en hurtigere og billigere model på hilsner og bekræftelser. Du betaler kun for nøjagtighed i topklasse, hvor det betyder noget .
  • Tal mens du venter: Værktøjsopkald tager tid. Når en agent skal bruge en API eller slå noget op midt i et opkald, kan den runde efterlade død luft på linjen. Tal mens du venter holder den, der ringer op, engageret med naturlig tale, mens værktøjsopkaldet kører, så pausen aldrig føles som om, der blev stille på linjen .
  • Videnbasebaseret forankring: den mest almindelige fejl af alle. Politikfabrikation og fejlagtige citater fra videnbasen er de to største hallucinationskategorier i benchmarken. Ved at forankre agenten i din egen videnbase forbliver svarene knyttet til dine reelle politikker i stedet for modellens bedste gæt .
  • Simuleringstest: de tilfælde, som denne benchmark ikke kan se. vCX-Hard kører på vores produktionstrafik. Dine sværeste kald er dine egne. Simuleringstest giver dig mulighed for at køre den samme type evaluering på dine scenarier, så du kan vælge og finjustere en model i forhold til de kald, du rent faktisk får .
  • AI QA: Benchmark-scoringsmodellerne, AI QA scorer dine opkald. vCX-Hard kører på et fast sæt; din produktion ændrer sig hele tiden. AI QA scorer løbende en stikprøve af dine liveopkald på de samme akser, der er vigtige her: hallucinationer, vidensbase-genkendelse og nøjagtighed af værktøjsopkald, plus brugerdefinerede metrikker, du definerer for, hvad der tæller som et godt opkald.

Modelvalg er trin et. Platformen omkring modellen er det, der forvandler en benchmarkscore til en implementering, du kan stole på.

Begrænsninger og hvad der nu skal ske

vCX-Hard er en tidlig version og har reelle begrænsninger. Bedømmelsen afhænger af et LLM-bedømmerpanel, som har sine egne bias. Sagerne er vurderet efter sværhedsgrad, så scorerne afspejler de sværeste ture snarere end den gennemsnitlige opkaldskvalitet. Og benchmarken måler to specifikke fejltilstande, ikke den fulde oplevelse af et opkald, såsom tone, latenstid eller afbrydelseshåndtering.

Vi holder vCX-Hard opdateret, efterhånden som nye modeller lanceres. Hver lancering rejser det samme spørgsmål hos alle teams, der kører voice agents: en ny model er ude, skal vi skifte? vCX-Hard er bygget til at besvare det med aktuelle data snarere end et gæt.

Hvorfor vi deler dette

Benchmarks er ikke til for at få tal til at se gode ud. De er til ærlig sammenligning. Når et mål er mættet, bygger feltet et sværere. vCX-Hard er den måde, vi vælger modeller internt på, og den måde, vi nu besvarer det spørgsmål, kunderne rent faktisk stiller, med beviser i stedet for et brandnavn. Vi vil fortsætte med at hæve barren, ligesom modellerne gør.

ROI Calculator
Estimate Your ROI from Automating Calls

See how much your business could save by switching to AI-powered voice agents.

All done! 
Your submission has been sent to your email
Oops! Something went wrong while submitting the form.
   1
   8
20
Oops! Something went wrong while submitting the form.

ROI Result

2,000

Total Human Agent Cost

$5,000
/month

AI Agent Cost

$3,000
/month

Estimated Savings

$2,000
/month
Live Demo
Prøv vores live demo

Et demonummer fra Retell Clinic Office

Tak! Din indsendelse er modtaget!
Ups! Noget gik galt under indsendelsen af formularen.

Read Other Blogs

Revolutionize your call operation with Retell