نقدّم vCX-Hard، معيارًا من Retell يصنّف النماذج الرائدة على مكالمات مراكز الاتصال الحقيقية، ويقيس قدرتين تحدّدان ما إذا كان الوكيل الصوتي سينجح: البقاء ملتزمًا بالحقيقة واتخاذ الإجراء الصحيح. مبنيًّا من بيانات مكالمات إنتاجية خاصة، يقيّم vCX-Hard أداء النماذج حيث يهمّ الأمر أكثر. حتى أفضل نموذج اليوم يحقق نحو 88% فقط على أصعب اللحظات، وهذا بالضبط ما يجعل اختيار النموذج مهمًّا.
يسألنا العملاء سؤالًا واحدًا أكثر من أي سؤال آخر: أي نموذج ينبغي أن أستخدم لوكيلي الصوتي؟ ولوقت طويل كانت الإجابة الداخلية الصادقة اسمًا وهزّة كتف. وبالنسبة لمنصّة تُدير ملايين المكالمات الحقيقية مع العملاء، فإن ذلك ليس كافيًا.
وكيل مركز الاتصال ينجح أو يفشل بناءً على قدرتين، اثنتين فقط:
نادرًا ما تختبر المعايير العامة القدرتين معًا، وتكاد لا تختبرهما أبدًا في ظروف مكالمة هاتفية حية. والبيانات القادرة على ذلك يصعب الحصول عليها. سجلّات مكالمات شركة واحدة ليست متنوعة بما يكفي لتصنيف النماذج بثقة. تجلس Retell على حركة مرور إنتاجية حقيقية ومتنوعة عبر صناعات وعمليات نشر عديدة، وبالحجم اللازم للتمييز بين نموذج وآخر. وهذا هو المكوّن الوحيد الذي يحتاجه أي معيار موثوق لمراكز الاتصال، وهو الذي لا تستطيع معظم الفرق تجميعه.
الاسم يقول ما هو. حرف v الصغير يرمز إلى الصوت (voice). CX هي تجربة العملاء، العمل اليومي لوكيل مركز الاتصال. Hard هي المنهج: نقيّم فقط على أصعب اللحظات من حركة المرور الإنتاجية الحقيقية، اللحظات التي تتباعد فيها النماذج فعلًا. على التوزيع الكامل للمكالمات الإنتاجية، تحقق معظم النماذج المتقدّمة بالفعل أكثر من 90 بالمئة، وهذا لا يخبرك بشيء مفيد. الشريحة الصعبة هي حيث يثبت المعيار جدارته.
كل حالة مستخرجة من مكالمات إنتاجية حقيقية، وليست مكتوبة يدويًا أو مولّدة تركيبيًا. نقيّم النماذج على المحورين اللذين يحدّدان المكالمة:
قيّمنا 50 إعدادًا تمتدّ عبر 27 نموذجًا. ولأن الوكلاء الصوتيين في الإنتاج يعملون بالاستدلال معطّلًا، لأجل زمن الاستجابة، نعرض رؤيتين طوال المقال: الإنتاج (الاستدلال معطّل، ما يعمل على المكالمات الحية) والأفضل (استدلال متوسط، سقف يبيّن مقدار ما يمكن أن يوفّره الاستدلال). يتصدّر GPT-5.5 الاثنين، إذ يبلغ 84.8 بالمئة عدم هلوسة في الإنتاج و88.0 بالمئة في أفضل حالاته. لا يوجد نموذج قريب من حلّ المشكلة، وهذا هو المقصود تمامًا.
أخذنا عيّنات من حركة المرور الإنتاجية للمكالمات بين 6 فبراير و1 مايو 2026، في نوافذ مدّتها 30 دقيقة تقريبًا كل 15 يومًا، مستمدّة من مؤسسات لديها أكثر من 1,000 مكالمة في الأشهر الثلاثة السابقة. والأهم أننا أخذنا العيّنات على مستوى المؤسسة، بحيث لا تهيمن بضع مؤسسات ذات حجم مرتفع على المجموعة. وهذا ما يبقي التوزيع واسعًا عبر عمليات النشر الحقيقية بدلًا من انحيازه نحو أي عميل واحد.
من تلك الحركة انتقينا مجموعتين من الحالات الصعبة: مجموعة هلوسة من 2,075 حالة ومجموعة استدعاء أدوات من 1,514 حالة. تُستخرج كل حالة عبر خطّ متعدّد المراحل. مصنّفات أولية خفيفة تُعلِّم اللحظات المرشّحة (ادعاءات رقمية، لحظات ما قبل التحويل، أخطاء الأدوات، استدعاءات مكرّرة أو مفقودة)، ثم يؤكّد مصنّف LLM ما إذا كان قد حدث فشل حقيقي ويصنّف فئته وشدّته، وتُعيد مرحلة ثانية فحص اللحظة المحدّدة، وأخيرًا يُولَّد حلّ مرجعي صحيح للتقييم.
تصنيف الأخطاء نفسه مفيد. على جانب الهلوسة، المشكلة السائدة ليست غريبة. يختلق الوكلاء أو يسيئون ذكر السياسة أكثر بكثير من أي شيء آخر.

تتجمّع أخطاء استدعاء الأدوات بالإحكام نفسه. من أصل 1,514 حالة، أكبر فئتين هما إغفال استدعاء لازم (897) وإطلاق استدعاء غير ضروري (520). اختيار الأداة الخاطئة يكاد ينعدم (حالتان). بعبارة أخرى، نادرًا ما تختار النماذج الأداة الخاطئة. إنها تفشل في الحُكم: معرفة متى تتصرّف ومتى تتريّث.
يستخدم التقييم مجلس LLM: لجنة من النماذج المتقدّمة الرائدة تقيّم كل حالة مقابل مقياس وصفي وحلّ مرجعي مولّد. استخدام عدة حكّام أقوياء بدلًا من واحد يمنع التقييم من وراثة النقاط العمياء لأي نموذج منفرد، وتُسوّى الخلافات داخل اللجنة.
ولأن الدرجات المطلقة تتغيّر مع المقياس والحكّام، نتعامل مع الترتيب، لا مع الرقم الدقيق، بوصفه الإشارة.
أعلى درجة نحو 88 بالمئة، وهذا مقصود بالتصميم. لو قيّمنا على التوزيع الإنتاجي الكامل، لحقّق كل نموذج متقدّم تقريبًا أكثر من 90 بالمئة ولما أخبرتك لوحة الصدارة بشيء. المكالمات السهلة سهلة على الجميع.
لذا فإن vCX-Hard مبنيّ من أصعب اللحظات، اللحظات التي تتباعد فيها النماذج فعلًا. هكذا يعمل كل معيار جادّ. معيار الرياضيات يستخدم مسائل مسابقات، لا العمليات الحسابية التي يكتبها المستخدم النموذجي. الهدف ليس رقمًا مُطريًا. الهدف رقم يمكنك مقارنته عبر النماذج، وعبر الزمن مع صدور نماذج جديدة.
نعرض كل لوحة صدارة بطريقتين: الإنتاج، بالاستدلال معطّلًا، وهو ما يعمل على المكالمات الحية، والأفضل، كل نموذج في أقوى إعداد استدلال لديه، وهو ما يبيّن السقف. على عدم الهلوسة، يتصدّر GPT-5.5 الاثنين. في الإنتاج يجلس خطّ GPT-5 وgemini-3.1-pro في القمة؛ وتشغيل الاستدلال يرفع الأسماء نفسها بضع نقاط ويعيد ترتيب المتنافسين خلفها.

صحّة استدعاء الأدوات هي حيث تتباعد الرؤيتان أكثر. مع تشغيل الاستدلال، يتصدّر GPT-5.5. لكن في الإنتاج، حيث يعمل فعلًا، يهبط استدعاء الأدوات لدى GPT-5.5 من 88.3 إلى 75.6 بالمئة، ويصبح gemini-3.1-pro أفضل مستدعٍ للأدوات بفارق واضح، محتفظًا بـ85.7 بالمئة بالاستدلال معطّلًا. إذا كان وكيلك يعمل بالاستدلال معطّلًا، فإن أقوى نموذج ليس هو نفسه.

تبرز ثلاثة أنماط عبر المجموعة الكاملة.
1. الاستدلال هو الفجوة بين الرؤيتين. تشغيل الاستدلال يرفع الدرجات على كل نموذج تقريبًا، بنحو 5 نقاط في المتوسط لعدم الهلوسة. يرتفع GPT-5.5 من 84.8 إلى 88.0 بالمئة بمجرد أن يستدلّ قبل أن يتكلّم. الكلفة هي زمن الاستجابة، ولهذا يتركه معظم الوكلاء الإنتاجيين معطّلًا، ولهذا فإن رؤية الإنتاج هي التي ينبغي التخطيط على أساسها.

2. الالتزام والتصرّف مهارتان مختلفتان. المحوران لا يُصنّفان بالطريقة نفسها. نموذج قوي في الالتزام قد يكون متوسطًا في استدعاء الأدوات والعكس صحيح. يحتلّ GPT-5.4 مرتبة قريبة من القمة في الالتزام لكنه خارج العشرة الأوائل في استدعاء الأدوات، بينما claude-4.5-sonnet هو العكس. اختيار نموذج هو في الحقيقة سؤال عن أي فشل لا يقدر عملاؤك على تحمّله.
3. لا يوجد نموذج آمن بعد. حتى في أفضل حالاته لا يزال المتصدّر يخطئ نحو واحدة من كل ثماني من أصعب اللحظات على كل محور، وفي الإنتاج يخطئ أكثر. الفجوة بين درجة معيار وعملية نشر يمكنك الوثوق بها هي بالضبط العمل الذي تؤدّيه المنصّة فوق النموذج.
بالنظر عبر أجيال النماذج، تتحرّك الجبهة في الاتجاه الصحيح. من GPT-4o إلى GPT-5.5، ارتفع عدم الهلوسة من 72.8 إلى 88.0 بالمئة، مع تحسّن استدعاء الأدوات على منحنى مماثل.

الإنتاج (الاستدلال معطّل، ما يعمل حيًّا) والأفضل (أقوى إعداد استدلال) لكل نموذج، مرتّبة حسب عدم الهلوسة في الإنتاج. الأعلى أفضل.
| النموذج | عدم الهلوسة % | استدعاء الأدوات % | ||
|---|---|---|---|---|
| الإنتاج (الاستدلال معطّل) | الأفضل (مع الاستدلال) | الإنتاج (الاستدلال معطّل) | الأفضل (مع الاستدلال) | |
| gpt-5.5 | 84.8% | 88.0% | 75.6% | 88.3% |
| gpt-5.4 | 83.0% | 83.3% | 75.2% | 77.4% |
| gemini-3.1-pro | 82.6% | 83.6% | 85.7% | 85.9% |
| gpt-5.2 | 81.3% | 81.6% | 79.6% | 81.5% |
| claude-4.6-sonnet | 81.2% | 81.6% | 80.1% | 80.4% |
| glm-5.1 | 79.3% | 82.7% | 77.3% | 83.8% |
| gpt-5.1 | 75.7% | 81.0% | 78.2% | 83.7% |
| gemini-3.1-flash-lite | 74.4% | 77.7% | 69.0% | 75.8% |
| gemini-3-flash | 73.8% | 80.1% | 71.2% | 81.8% |
| gpt-4o | 72.8% | 72.8% | 63.6% | 63.6% |
| claude-4.5-haiku | 72.4% | 78.7% | 70.7% | 79.4% |
| gemini-2.5-pro | 72.3% | 77.2% | 72.9% | 80.6% |
| gemini-3.5-flash | 72.0% | 80.7% | 69.2% | 84.0% |
| claude-4.5-sonnet | 71.5% | 80.6% | 77.5% | 85.8% |
| gpt-4.1 | 71.5% | 71.5% | 62.2% | 62.2% |
| gpt-5 | 71.2% | 78.8% | 68.9% | 83.2% |
| gpt-5.4-mini | 70.7% | 71.3% | 57.1% | 60.2% |
| gpt-5-mini | 69.4% | 75.2% | 70.6% | 75.6% |
| o4-mini | 67.9% | 67.9% | 73.9% | 73.9% |
| gpt-5.4-nano | 66.2% | 66.3% | 57.5% | 59.1% |
| grok-4.3 | 65.8% | 76.3% | 54.6% | 72.1% |
| kimi-k2.6 | 63.5% | 63.5% | 66.3% | 66.3% |
| o3-mini | 62.7% | 62.7% | 59.0% | 59.0% |
| gemini-2.5-flash-lite | 59.8% | 75.2% | 47.0% | 70.3% |
| mercury-2 | 56.7% | 61.9% | 52.2% | 55.9% |
| gpt-5-nano | 53.9% | 57.6% | 54.5% | 56.1% |
| deepseek-v4-pro | 49.8% | 55.6% | 58.9% | 64.5% |
الإنتاج هو كل نموذج بالاستدلال معطّلًا، أو أدنى إعداد متاح لديه. الأفضل هو أقوى إعداد استدلال لديه. النماذج ذات الأعمدة المتطابقة (gpt-4o وgpt-4.1 وkimi-k2.6 وo4-mini وo3-mini) قُيّم لها إعداد واحد.
المعيار مفيد فقط إذا غيّر الطريقة التي تبني بها. الفجوات التي يكشفها vCX-Hard تنعكس مباشرة على الميزات في منصّة Retell، حتى لا تضطرّ إلى بنائها بنفسك.
اختيار النموذج هو الخطوة الأولى. المنصّة المحيطة بالنموذج هي ما يحوّل درجة المعيار إلى عملية نشر يمكنك الوثوق بها.
vCX-Hard نسخة مبكرة وله قيود حقيقية. يعتمد التقييم على لجنة حكّام LLM، التي تحمل تحيّزاتها الخاصة. الحالات مستخرجة للصعوبة، لذا تعكس الدرجات أصعب اللحظات بدلًا من متوسط جودة المكالمة. والمعيار يقيس نمطي فشل محدّدين، لا التجربة الكاملة للمكالمة مثل النبرة أو زمن الاستجابة أو التعامل مع المقاطعة.
سنبقي vCX-Hard محدّثًا مع صدور نماذج جديدة. كل إطلاق يثير السؤال نفسه في كل فريق يشغّل وكلاء صوتيين: صدر نموذج جديد، هل نبدّل؟ vCX-Hard مبنيّ للإجابة عن ذلك ببيانات حالية بدلًا من تخمين.
المعايير ليست لجعل الأرقام تبدو جيدة. إنها للمقارنة الصادقة. عندما يتشبّع أحدها، يبني المجال معيارًا أصعب. vCX-Hard هو الطريقة التي نختار بها النماذج داخليًا، والطريقة التي نجيب بها الآن عن السؤال الذي يطرحه العملاء فعلًا، بالأدلّة بدلًا من اسم علامة تجارية. سنبقي نرفع المستوى ما دامت النماذج تفعل ذلك.
See how much your business could save by switching to AI-powered voice agents.
Total Human Agent Cost
AI Agent Cost
Estimated Savings
رقم هاتف تجريبي من Retell Clinic Office

Start building smarter conversations today.




.avif)