Vi presenterar vCX-Hard, ett Retell-riktmärke som rankar ledande modeller på verkliga kontaktcentersamtal och mäter två förmågor som avgör om en röstagent lyckas: att hålla sig förankrad i sanningen och att vidta rätt åtgärder. vCX-Hard är byggt utifrån egenutvecklad produktionsdata och utvärderar modellens prestanda där det spelar mest roll. Även den bästa modellen idag klarar bara cirka 88 % av de svåraste vändningarna, vilket är just därför modellvalet är viktigt.
Kunderna ställer oss en fråga mer än någon annan: vilken modell ska jag använda för min röstagent? Länge var det ärliga interna svaret ett namn och en axelryckning. För en plattform som hanterar miljontals riktiga kundsamtal är det inte tillräckligt.
En callcenteragent lever eller dör på två förmågor, och bara två:
Offentliga riktmärken testar sällan båda samtidigt, och nästan aldrig under ett live-telefonsamtal. Den data som kan uppnås är svår att få tag på. Ett enskilt företags egna samtalsloggar är inte tillräckligt mångsidiga för att rangordna modeller med säkerhet. Retell använder verklig, mångsidig produktionstrafik från många branscher och implementeringar, med den volym som krävs för att skilja en modell från en annan. Det är den enda ingrediensen som ett pålitligt callcenter-riktmärke behöver, och det är den som de flesta team inte kan sätta ihop.
Namnet säger vad det är. Det lilla v:et står för röst. CX står för kundupplevelse, det dagliga arbetet för en callcenteragent. Hård är metoden: vi betygsätter bara de svåraste vändningarna från verklig produktionstrafik, de ögonblick där modeller faktiskt faller isär. Vid den fulla fördelningen av produktionssamtal klarar de flesta frontiermodeller redan 90 procent, vilket inte säger dig något användbart. Den hårda delen är där ett riktmärke förtjänar sin plats.
Varje fall utvinns från verkliga produktionsanrop, inte skrivna för hand eller genererade syntetiskt. Vi poängsätter modeller på de två axlar som avgör ett anrop:
Vi utvärderade 50 konfigurationer som spänner över 27 modeller. Eftersom röstagenter i produktion körs med resonemang avstängt, rapporterar vi två vyer för latens: produktion (resonemang avstängt, vad som körs på live-samtal) och bästa (medelstor resonemang, ett tak för hur mycket resonemang skulle köpa). GPT-5.5 leder båda och når 84,8 procent icke-hallucinationer i produktion och 88,0 procent som bäst. Ingen modell är i närheten av löst, vilket är precis poängen.
Vi samplade samtalstrafiken i produktionen mellan den 6 februari och den 1 maj 2026, i 30-minutersfönster ungefär var 15:e dag, hämtade från organisationer med fler än 1 000 samtal under de föregående tre månaderna. Avgörande var att vi samplade på organisationsnivå, så att ett fåtal organisationer med hög volym inte dominerar. Det är det som gör att fördelningen är bred över verkliga implementeringar snarare än snedvriden mot en enskild kund.
Från den trafiken valde vi ut två uppsättningar svåra fall: en hallucinationsuppsättning med 2 075 fall och en verktygsanropsuppsättning med 1 514 fall. Varje fall utvinns genom en flerstegspipeline. Lätta förklassificerare markerar kandidatomgångar (numeriska anspråk, moment före överföring, verktygsfel, upprepade eller saknade anrop), en LLM-klassificerare bekräftar sedan om ett verkligt fel inträffade och märker dess kategori och allvarlighetsgrad, ett andra steg kontrollerar den specifika omgången igen och slutligen genereras en korrekt referenslösning för gradering.
Själva misslyckandetaxonomin är informativ. På hallucinationssidan är det dominerande problemet inte exotiskt. Agenter fabricerar eller felaktigt formulerar policyer i mycket större utsträckning än något annat.

Misslyckanden med verktygsanrop grupperas lika tätt. Av 1 514 fall är de två största kategorierna att ett nödvändigt anrop missas ( 897 ) och att ett onödigt anrop utlöses ( 520 ). Felaktigt verktygsval förekommer nästan inte (2 fall). Med andra ord väljer modeller sällan fel verktyg. De misslyckas med bedömningen: att veta när de ska agera och när de ska vänta.
Betygsättningen sker med hjälp av ett LLM-råd: en panel av ledande frontmodeller som poängsätter varje fall utifrån en beskrivande matris och en genererad referenslösning. Genom att använda flera starka bedömare snarare än en enda förhindrar man att utvärderingen ärver en enskild modells blinda fläckar, och oenigheter löses inom panelen.
Eftersom absoluta poäng varierar beroende på bedömningskriterier och domare, behandlar vi rankningen, inte det exakta numret, som signalen.
Topppoängen ligger på cirka 88 procent, och det är avsiktligt. Om vi bedömde utifrån den fulla produktionsdistributionen skulle nästan alla frontmodeller landa över 90 procent och topplistan skulle inte säga något. Enkla beslut är enkla för alla.
Så vCX-Hard är byggt utifrån de svåraste vändningarna, de ögonblick där modeller faktiskt divergerar. Det är så varje seriöst riktmärke fungerar. Ett matematiskt riktmärke använder konkurrensproblem, inte den aritmetik som en typisk användare skriver in. Målet är inte ett smickrande nummer. Målet är ett nummer du kan jämföra mellan modeller och över tid allt eftersom nya modeller lanseras.
Vi visar varje topplista på två sätt: i produktion, med resonemang avstängt, vilket är vad som körs vid live-utrop, och bäst, varje modell med sin starkaste resonemangsinställning, vilket visar maximumvärdet. På icke-hallucinationer leder GPT-5.5 båda. I produktion ligger GPT-5-serien och Gemini-3.1-pro i toppen; att aktivera resonemang lyfter samma namn några poäng och omorganiserar jakten bakom dem.

Det är i verktygskallningsanspråkets korrekthet som de två åsikterna skiljer sig mest åt. Med resonemang aktiverat leder GPT-5.5. Men i produktion, där det faktiskt körs, faller GPT-5.5:s verktygskallningsanspråk från 88,3 till 75,6 procent, och gemini-3.1-pro blir den bästa verktygskallningsanspråkstagaren med klar marginal, med 85,7 procent med resonemang av. Om din agent kör resonemang av, är den starkaste modellen inte densamma.

Tre mönster sticker ut över hela uppsättningen.
1. Resonemang är gapet mellan de två synsätten. Att aktivera resonemang höjer poängen på nästan alla modeller, med cirka 5 poäng i genomsnitt för icke-hallucinationer. GPT-5.5 klättrar från 84,8 till 88,0 procent när den resonerar innan den talar. Kostnaden är latens, vilket är anledningen till att de flesta produktionsagenter lämnar den avstängd, och varför produktionssynen är den man bör planera kring.

2. Jordning och handling är olika färdigheter. De två axlarna rankas inte lika. En modell som är stark på jordning kan vara medelmåttig på verktygskallning och tvärtom. GPT-5.4 rankas nära toppen på jordning men utanför topp tio på verktygskallning, medan claude-4.5-sonnet är motsatsen. Att välja en modell är egentligen en fråga om vilket misslyckande dina kunder har minst råd med.
3. Ingen modell är säker ännu. Även i bästa fall missar ledaren fortfarande ungefär en av åtta av de svåraste svängarna på varje axel, och i produktion missar den fler. Skillnaden mellan ett riktmärkesresultat och en driftsättning du kan lita på är precis det arbete som plattformen gör ovanpå modellen.
Om man tittar på olika modellgenerationer går utvecklingen i rätt riktning. Från GPT-4o till GPT-5.5 ökade icke-hallucinationer från 72,8 till 88,0 procent, med verktygsanrop som förbättrades i en liknande riktning.

Produktion (resonemang av, vad som körs live) och bäst (starkast resonemangsinställning) för varje modell, sorterat efter produktionsmässig icke-hallucination. Högre desto bättre.
| Modell | Icke-hallucinationer % | Verktygsanrop % | ||
|---|---|---|---|---|
| Stöt (resonemang bort) | Bäst (med motivering) | Stöt (resonemang bort) | Bäst (med motivering) | |
| gpt-5.5 | 84,8 % | 88,0 % | 75,6 % | 88,3 % |
| gpt-5.4 | 83,0 % | 83,3 % | 75,2 % | 77,4 % |
| Gemini-3.1-pro | 82,6 % | 83,6 % | 85,7 % | 85,9 % |
| gpt-5.2 | 81,3 % | 81,6 % | 79,6 % | 81,5 % |
| claude-4.6-sonett | 81,2 % | 81,6 % | 80,1 % | 80,4 % |
| glm-5.1 | 79,3 % | 82,7 % | 77,3 % | 83,8 % |
| gpt-5.1 | 75,7 % | 81,0 % | 78,2 % | 83,7 % |
| Gemini 3.1 Flash Lite | 74,4 % | 77,7 % | 69,0 % | 75,8 % |
| Gemini-3-blixt | 73,8 % | 80,1 % | 71,2 % | 81,8 % |
| gpt-4o | 72,8 % | 72,8 % | 63,6 % | 63,6 % |
| claude-4.5-haiku | 72,4 % | 78,7 % | 70,7 % | 79,4 % |
| Gemini-2.5-pro | 72,3 % | 77,2 % | 72,9 % | 80,6 % |
| Gemini-3,5-blixt | 72,0 % | 80,7 % | 69,2 % | 84,0 % |
| claude-4.5-sonnett | 71,5 % | 80,6 % | 77,5 % | 85,8 % |
| gpt-4.1 | 71,5 % | 71,5 % | 62,2 % | 62,2 % |
| gpt-5 | 71,2 % | 78,8 % | 68,9 % | 83,2 % |
| gpt-5.4-mini | 70,7 % | 71,3 % | 57,1 % | 60,2 % |
| gpt-5-mini | 69,4 % | 75,2 % | 70,6 % | 75,6 % |
| o4-mini | 67,9 % | 67,9 % | 73,9 % | 73,9 % |
| gpt-5.4-nano | 66,2 % | 66,3 % | 57,5 % | 59,1 % |
| grok-4.3 | 65,8 % | 76,3 % | 54,6 % | 72,1 % |
| kimi-k2.6 | 63,5 % | 63,5 % | 66,3 % | 66,3 % |
| o3-mini | 62,7 % | 62,7 % | 59,0 % | 59,0 % |
| Gemini 2.5-blixt-lite | 59,8 % | 75,2 % | 47,0 % | 70,3 % |
| kvicksilver-2 | 56,7 % | 61,9 % | 52,2 % | 55,9 % |
| gpt-5-nano | 53,9 % | 57,6 % | 54,5 % | 56,1 % |
| deepseek-v4-pro | 49,8 % | 55,6 % | 58,9 % | 64,5 % |
Prod är varje modell med resonemang av, eller dess lägsta tillgängliga inställning. Best är dess starkaste resonemangsinställning. Modeller med matchande kolumner (gpt-4o, gpt-4.1, kimi-k2.6, o4-mini, o3-mini) hade en enda inställning utvärderad.
Ett riktmärke är bara användbart om det förändrar hur du bygger. Gaps vCX-Hard exponerar kartan direkt på funktioner i Retell-plattformen, så att du inte behöver leverera dem.
Modellvalet är steg ett. Plattformen runt modellen är det som förvandlar ett riktmärke till en driftsättning du kan lita på.
vCX-Hard är en tidig version och har verkliga begränsningar. Betygsättningen vilar på en jury för LLM, som har sina egna fördomar. Fallen granskas utifrån svårighetsgrad, så poängen återspeglar de svåraste vändningarna snarare än genomsnittlig samtalskvalitet. Och riktmärket mäter två specifika fellägen, inte den fullständiga upplevelsen av ett samtal, såsom ton, latens eller avbrottshantering.
Vi kommer att hålla vCX-Hard uppdaterade allt eftersom nya modeller lanseras. Varje lansering väcker samma fråga hos alla team som använder röstagenter: en ny modell är ute, ska vi byta? vCX-Hard är byggt för att besvara det med aktuell data snarare än en gissning.
Riktmärken är inte till för att få siffror att se bra ut. De är till för ärliga jämförelser. När ett område mättas bygger fältet ett svårare. vCX-Hard är hur vi väljer modeller internt, och hur vi nu svarar på den fråga kunder faktiskt ställer, med bevis istället för ett varumärke. Vi kommer att fortsätta höja ribban som modellerna gör.
See how much your business could save by switching to AI-powered voice agents.
Total Human Agent Cost
AI Agent Cost
Estimated Savings
Ett demonummer från Retell Clinic Office

Start building smarter conversations today.




.avif)