vCX-Hard: Jämförelse av ledande AI-modeller med verkliga kontaktcentersamtal

vCX-Hard: Jämförelse av ledande AI-modeller med verkliga kontaktcentersamtal
BACK TO BLOGS
ON THIS PAGE
Back to top

Vi presenterar vCX-Hard, ett Retell-riktmärke som rankar ledande modeller på verkliga kontaktcentersamtal och mäter två förmågor som avgör om en röstagent lyckas: att hålla sig förankrad i sanningen och att vidta rätt åtgärder. vCX-Hard är byggt utifrån egenutvecklad produktionsdata och utvärderar modellens prestanda där det spelar mest roll. Även den bästa modellen idag klarar bara cirka 88 % av de svåraste vändningarna, vilket är just därför modellvalet är viktigt.

Varför vi byggde detta

Kunderna ställer oss en fråga mer än någon annan: vilken modell ska jag använda för min röstagent? Länge var det ärliga interna svaret ett namn och en axelryckning. För en plattform som hanterar miljontals riktiga kundsamtal är det inte tillräckligt.

En callcenteragent lever eller dör på två förmågor, och bara två:

  • Håll dig på jord. Svara utifrån företagets verkliga policyer och kunskap. Hitta aldrig på en avgift, en regel eller ett löfte.
  • Agera korrekt. Tillkalla rätt verktyg, med rätt argument, i rätt ögonblick. Hoppa inte över ett nödvändigt steg och vidta inte en åtgärd som ingen bett om.

Offentliga riktmärken testar sällan båda samtidigt, och nästan aldrig under ett live-telefonsamtal. Den data som kan uppnås är svår att få tag på. Ett enskilt företags egna samtalsloggar är inte tillräckligt mångsidiga för att rangordna modeller med säkerhet. Retell använder verklig, mångsidig produktionstrafik från många branscher och implementeringar, med den volym som krävs för att skilja en modell från en annan. Det är den enda ingrediensen som ett pålitligt callcenter-riktmärke behöver, och det är den som de flesta team inte kan sätta ihop.

Introduktion av vCX-Hard

Namnet säger vad det är. Det lilla v:et står för röst. CX står för kundupplevelse, det dagliga arbetet för en callcenteragent. Hård är metoden: vi betygsätter bara de svåraste vändningarna från verklig produktionstrafik, de ögonblick där modeller faktiskt faller isär. Vid den fulla fördelningen av produktionssamtal klarar de flesta frontiermodeller redan 90 procent, vilket inte säger dig något användbart. Den hårda delen är där ett riktmärke förtjänar sin plats.

Varje fall utvinns från verkliga produktionsanrop, inte skrivna för hand eller genererade syntetiskt. Vi poängsätter modeller på de två axlar som avgör ett anrop:

  • Icke-hallucinationsfrekvens. Hur tillförlitligt agenten förblir jordad och vägrar att hitta på saker.
  • Korrekthetsgrad för verktygsbesked. Hur tillförlitligt agenten väljer och utför rätt åtgärder.

Vi utvärderade 50 konfigurationer som spänner över 27 modeller. Eftersom röstagenter i produktion körs med resonemang avstängt, rapporterar vi två vyer för latens: produktion (resonemang avstängt, vad som körs på live-samtal) och bästa (medelstor resonemang, ett tak för hur mycket resonemang skulle köpa). GPT-5.5 leder båda och når 84,8 procent icke-hallucinationer i produktion och 88,0 procent som bäst. Ingen modell är i närheten av löst, vilket är precis poängen.

Hur vi byggde datamängden

Vi samplade samtalstrafiken i produktionen mellan den 6 februari och den 1 maj 2026, i 30-minutersfönster ungefär var 15:e dag, hämtade från organisationer med fler än 1 000 samtal under de föregående tre månaderna. Avgörande var att vi samplade på organisationsnivå, så att ett fåtal organisationer med hög volym inte dominerar. Det är det som gör att fördelningen är bred över verkliga implementeringar snarare än snedvriden mot en enskild kund.

Från den trafiken valde vi ut två uppsättningar svåra fall: en hallucinationsuppsättning med 2 075 fall och en verktygsanropsuppsättning med 1 514 fall. Varje fall utvinns genom en flerstegspipeline. Lätta förklassificerare markerar kandidatomgångar (numeriska anspråk, moment före överföring, verktygsfel, upprepade eller saknade anrop), en LLM-klassificerare bekräftar sedan om ett verkligt fel inträffade och märker dess kategori och allvarlighetsgrad, ett andra steg kontrollerar den specifika omgången igen och slutligen genereras en korrekt referenslösning för gradering.

Själva misslyckandetaxonomin är informativ. På hallucinationssidan är det dominerande problemet inte exotiskt. Agenter fabricerar eller felaktigt formulerar policyer i mycket större utsträckning än något annat.

__wf_reserved_inherit
Figur 1. Hallucinationskategorier över 2 075 utvalda fall. Källa: Retell-Eval.

Misslyckanden med verktygsanrop grupperas lika tätt. Av 1 514 fall är de två största kategorierna att ett nödvändigt anrop missas ( 897 ) och att ett onödigt anrop utlöses ( 520 ). Felaktigt verktygsval förekommer nästan inte (2 fall). Med andra ord väljer modeller sällan fel verktyg. De misslyckas med bedömningen: att veta när de ska agera och när de ska vänta.

Hur vi betygsätter

Betygsättningen sker med hjälp av ett LLM-råd: en panel av ledande frontmodeller som poängsätter varje fall utifrån en beskrivande matris och en genererad referenslösning. Genom att använda flera starka bedömare snarare än en enda förhindrar man att utvärderingen ärver en enskild modells blinda fläckar, och oenigheter löses inom panelen.

Eftersom absoluta poäng varierar beroende på bedömningskriterier och domare, behandlar vi rankningen, inte det exakta numret, som signalen.

Varför vi graderar på de svåraste svängarna

Topppoängen ligger på cirka 88 procent, och det är avsiktligt. Om vi bedömde utifrån den fulla produktionsdistributionen skulle nästan alla frontmodeller landa över 90 procent och topplistan skulle inte säga något. Enkla beslut är enkla för alla.

Så vCX-Hard är byggt utifrån de svåraste vändningarna, de ögonblick där modeller faktiskt divergerar. Det är så varje seriöst riktmärke fungerar. Ett matematiskt riktmärke använder konkurrensproblem, inte den aritmetik som en typisk användare skriver in. Målet är inte ett smickrande nummer. Målet är ett nummer du kan jämföra mellan modeller och över tid allt eftersom nya modeller lanseras.

Resultat

Vi visar varje topplista på två sätt: i produktion, med resonemang avstängt, vilket är vad som körs vid live-utrop, och bäst, varje modell med sin starkaste resonemangsinställning, vilket visar maximumvärdet. På icke-hallucinationer leder GPT-5.5 båda. I produktion ligger GPT-5-serien och Gemini-3.1-pro i toppen; att aktivera resonemang lyfter samma namn några poäng och omorganiserar jakten bakom dem.

__wf_reserved_inherit
Figur 2. Icke-hallucinationsfrekvens, topp 12 modeller. Produktion kontra bästa.

Det är i verktygskallningsanspråkets korrekthet som de två åsikterna skiljer sig mest åt. Med resonemang aktiverat leder GPT-5.5. Men i produktion, där det faktiskt körs, faller GPT-5.5:s verktygskallningsanspråk från 88,3 till 75,6 procent, och gemini-3.1-pro blir den bästa verktygskallningsanspråkstagaren med klar marginal, med 85,7 procent med resonemang av. Om din agent kör resonemang av, är den starkaste modellen inte densamma.

__wf_reserved_inherit
Figur 3. Verktygsberäkningens korrekthet, topp 12 modeller. Produktion kontra bästa.

Tre mönster sticker ut över hela uppsättningen.

1. Resonemang är gapet mellan de två synsätten. Att aktivera resonemang höjer poängen på nästan alla modeller, med cirka 5 poäng i genomsnitt för icke-hallucinationer. GPT-5.5 klättrar från 84,8 till 88,0 procent när den resonerar innan den talar. Kostnaden är latens, vilket är anledningen till att de flesta produktionsagenter lämnar den avstängd, och varför produktionssynen är den man bör planera kring.

__wf_reserved_inherit
Figur 4. Resonemangsstörning kontra medelhög, icke-hallucinationsfrekvens.

2. Jordning och handling är olika färdigheter. De två axlarna rankas inte lika. En modell som är stark på jordning kan vara medelmåttig på verktygskallning och tvärtom. GPT-5.4 rankas nära toppen på jordning men utanför topp tio på verktygskallning, medan claude-4.5-sonnet är motsatsen. Att välja en modell är egentligen en fråga om vilket misslyckande dina kunder har minst råd med.

3. Ingen modell är säker ännu. Även i bästa fall missar ledaren fortfarande ungefär en av åtta av de svåraste svängarna på varje axel, och i produktion missar den fler. Skillnaden mellan ett riktmärkesresultat och en driftsättning du kan lita på är precis det arbete som plattformen gör ovanpå modellen.

Om man tittar på olika modellgenerationer går utvecklingen i rätt riktning. Från GPT-4o till GPT-5.5 ökade icke-hallucinationer från 72,8 till 88,0 procent, med verktygsanrop som förbättrades i en liknande riktning.

__wf_reserved_inherit
Figur 5. OpenAI-modellgenereringar på vCX-Hard, bästa standardinställning.

Fullständig topplista

Produktion (resonemang av, vad som körs live) och bäst (starkast resonemangsinställning) för varje modell, sorterat efter produktionsmässig icke-hallucination. Högre desto bättre.

Modell Icke-hallucinationer % Verktygsanrop %
Stöt (resonemang bort) Bäst (med motivering) Stöt (resonemang bort) Bäst (med motivering)
gpt-5.5 84,8 % 88,0 % 75,6 % 88,3 %
gpt-5.4 83,0 % 83,3 % 75,2 % 77,4 %
Gemini-3.1-pro 82,6 % 83,6 % 85,7 % 85,9 %
gpt-5.2 81,3 % 81,6 % 79,6 % 81,5 %
claude-4.6-sonett 81,2 % 81,6 % 80,1 % 80,4 %
glm-5.1 79,3 % 82,7 % 77,3 % 83,8 %
gpt-5.1 75,7 % 81,0 % 78,2 % 83,7 %
Gemini 3.1 Flash Lite 74,4 % 77,7 % 69,0 % 75,8 %
Gemini-3-blixt 73,8 % 80,1 % 71,2 % 81,8 %
gpt-4o 72,8 % 72,8 % 63,6 % 63,6 %
claude-4.5-haiku 72,4 % 78,7 % 70,7 % 79,4 %
Gemini-2.5-pro 72,3 % 77,2 % 72,9 % 80,6 %
Gemini-3,5-blixt 72,0 % 80,7 % 69,2 % 84,0 %
claude-4.5-sonnett 71,5 % 80,6 % 77,5 % 85,8 %
gpt-4.1 71,5 % 71,5 % 62,2 % 62,2 %
gpt-5 71,2 % 78,8 % 68,9 % 83,2 %
gpt-5.4-mini 70,7 % 71,3 % 57,1 % 60,2 %
gpt-5-mini 69,4 % 75,2 % 70,6 % 75,6 %
o4-mini 67,9 % 67,9 % 73,9 % 73,9 %
gpt-5.4-nano 66,2 % 66,3 % 57,5 % 59,1 %
grok-4.3 65,8 % 76,3 % 54,6 % 72,1 %
kimi-k2.6 63,5 % 63,5 % 66,3 % 66,3 %
o3-mini 62,7 % 62,7 % 59,0 % 59,0 %
Gemini 2.5-blixt-lite 59,8 % 75,2 % 47,0 % 70,3 %
kvicksilver-2 56,7 % 61,9 % 52,2 % 55,9 %
gpt-5-nano 53,9 % 57,6 % 54,5 % 56,1 %
deepseek-v4-pro 49,8 % 55,6 % 58,9 % 64,5 %

Prod är varje modell med resonemang av, eller dess lägsta tillgängliga inställning. Best är dess starkaste resonemangsinställning. Modeller med matchande kolumner (gpt-4o, gpt-4.1, kimi-k2.6, o4-mini, o3-mini) hade en enda inställning utvärderad.

Från fynd till produktion

Ett riktmärke är bara användbart om det förändrar hur du bygger. Gaps vCX-Hard exponerar kartan direkt på funktioner i Retell-plattformen, så att du inte behöver leverera dem.

  • LLM per nod: ingen modell vinner överallt. Jordning och handling är olika färdigheter, och den bästa modellen på en svår tur är överdriven på en enkel. LLM per nod låter dig dirigera varje steg i en konversation till rätt modell: din starkaste modell på de svåraste turerna med högst insatser, en snabbare och billigare på hälsningar och bekräftelser. Du betalar bara för högsta noggrannhet där det spelar roll .
  • Prata medan man väntar: verktygsanrop tar tid. När en agent måste öppna ett API eller slå upp något mitt i ett samtal kan den där rundresan leda till att linjen är tom. Att prata medan man väntar håller uppringaren engagerad med naturligt tal medan verktygsanropet pågår, så pausen känns aldrig som att linjen blev tyst .
  • Kunskapsbasförankring: det vanligaste misslyckandet av alla. Policyfabrikation och felaktiga citat i kunskapsbasen är de två största hallucinationskategorierna i riktmärket. Att förankra agenten i din egen kunskapsbas håller svaren knutna till dina verkliga policyer istället för modellens bästa gissning .
  • Simuleringstestning: de fall som detta riktmärke inte kan se. vCX-Hard körs på vår produktionstrafik. Dina svåraste anrop är dina egna. Simuleringstestning låter dig köra samma typ av utvärdering på dina scenarier, så att du kan välja och finjustera en modell mot de anrop du faktiskt får .
  • AI QA: benchmark-poängmodellerna, AI QA poängsätter dina samtal. vCX-Hard körs på en fast uppsättning; din produktion förändras ständigt. AI QA poängsätter kontinuerligt ett urval av dina live-samtal på samma axlar som är viktiga här, hallucinationer, kunskapsbasåterkallelse och noggrannhet i verktygssamtal, plus anpassade mätvärden som du definierar för vad som räknas som ett bra samtal.

Modellvalet är steg ett. Plattformen runt modellen är det som förvandlar ett riktmärke till en driftsättning du kan lita på.

Begränsningar och vad som händer härnäst

vCX-Hard är en tidig version och har verkliga begränsningar. Betygsättningen vilar på en jury för LLM, som har sina egna fördomar. Fallen granskas utifrån svårighetsgrad, så poängen återspeglar de svåraste vändningarna snarare än genomsnittlig samtalskvalitet. Och riktmärket mäter två specifika fellägen, inte den fullständiga upplevelsen av ett samtal, såsom ton, latens eller avbrottshantering.

Vi kommer att hålla vCX-Hard uppdaterade allt eftersom nya modeller lanseras. Varje lansering väcker samma fråga hos alla team som använder röstagenter: en ny modell är ute, ska vi byta? vCX-Hard är byggt för att besvara det med aktuell data snarare än en gissning.

Varför vi delar detta

Riktmärken är inte till för att få siffror att se bra ut. De är till för ärliga jämförelser. När ett område mättas bygger fältet ett svårare. vCX-Hard är hur vi väljer modeller internt, och hur vi nu svarar på den fråga kunder faktiskt ställer, med bevis istället för ett varumärke. Vi kommer att fortsätta höja ribban som modellerna gör.

ROI Calculator
Estimate Your ROI from Automating Calls

See how much your business could save by switching to AI-powered voice agents.

All done! 
Your submission has been sent to your email
Oops! Something went wrong while submitting the form.
   1
   8
20
Oops! Something went wrong while submitting the form.

ROI Result

2,000

Total Human Agent Cost

$5,000
/month

AI Agent Cost

$3,000
/month

Estimated Savings

$2,000
/month
Live Demo
Prova vår live-demo

Ett demonummer från Retell Clinic Office

Tack! Din inskickning har mottagits!
Hoppsan! Något gick fel när formuläret skickades.

Read Other Blogs

Revolutionize your call operation with Retell