vCX-Hard: قياس أداء نماذج الذكاء الاصطناعي الرائدة على مكالمات مراكز الاتصال الحقيقية

vCX-Hard: قياس أداء نماذج الذكاء الاصطناعي الرائدة على مكالمات مراكز الاتصال الحقيقية
BACK TO BLOGS
ON THIS PAGE
Back to top

نقدّم vCX-Hard، معيارًا من Retell يصنّف النماذج الرائدة على مكالمات مراكز الاتصال الحقيقية، ويقيس قدرتين تحدّدان ما إذا كان الوكيل الصوتي سينجح: البقاء ملتزمًا بالحقيقة واتخاذ الإجراء الصحيح. مبنيًّا من بيانات مكالمات إنتاجية خاصة، يقيّم vCX-Hard أداء النماذج حيث يهمّ الأمر أكثر. حتى أفضل نموذج اليوم يحقق نحو 88% فقط على أصعب اللحظات، وهذا بالضبط ما يجعل اختيار النموذج مهمًّا.

لماذا بنينا هذا

يسألنا العملاء سؤالًا واحدًا أكثر من أي سؤال آخر: أي نموذج ينبغي أن أستخدم لوكيلي الصوتي؟ ولوقت طويل كانت الإجابة الداخلية الصادقة اسمًا وهزّة كتف. وبالنسبة لمنصّة تُدير ملايين المكالمات الحقيقية مع العملاء، فإن ذلك ليس كافيًا.

وكيل مركز الاتصال ينجح أو يفشل بناءً على قدرتين، اثنتين فقط:

  • البقاء ملتزمًا. الإجابة من سياسات الشركة ومعرفتها الحقيقية. عدم اختلاق رسم أو قاعدة أو وعد أبدًا.
  • التصرّف بشكل صحيح. استدعاء الأداة الصحيحة، بالوسائط الصحيحة، في اللحظة الصحيحة. عدم تخطّي خطوة لازمة، وعدم اتخاذ إجراء لم يطلبه أحد.

نادرًا ما تختبر المعايير العامة القدرتين معًا، وتكاد لا تختبرهما أبدًا في ظروف مكالمة هاتفية حية. والبيانات القادرة على ذلك يصعب الحصول عليها. سجلّات مكالمات شركة واحدة ليست متنوعة بما يكفي لتصنيف النماذج بثقة. تجلس Retell على حركة مرور إنتاجية حقيقية ومتنوعة عبر صناعات وعمليات نشر عديدة، وبالحجم اللازم للتمييز بين نموذج وآخر. وهذا هو المكوّن الوحيد الذي يحتاجه أي معيار موثوق لمراكز الاتصال، وهو الذي لا تستطيع معظم الفرق تجميعه.

نقدّم vCX-Hard

الاسم يقول ما هو. حرف v الصغير يرمز إلى الصوت (voice). CX هي تجربة العملاء، العمل اليومي لوكيل مركز الاتصال. Hard هي المنهج: نقيّم فقط على أصعب اللحظات من حركة المرور الإنتاجية الحقيقية، اللحظات التي تتباعد فيها النماذج فعلًا. على التوزيع الكامل للمكالمات الإنتاجية، تحقق معظم النماذج المتقدّمة بالفعل أكثر من 90 بالمئة، وهذا لا يخبرك بشيء مفيد. الشريحة الصعبة هي حيث يثبت المعيار جدارته.

كل حالة مستخرجة من مكالمات إنتاجية حقيقية، وليست مكتوبة يدويًا أو مولّدة تركيبيًا. نقيّم النماذج على المحورين اللذين يحدّدان المكالمة:

  • معدّل عدم الهلوسة. مدى موثوقية بقاء الوكيل ملتزمًا ورفضه اختلاق الأمور.
  • معدّل صحّة استدعاء الأدوات. مدى موثوقية اختيار الوكيل للإجراءات الصحيحة وتنفيذها.

قيّمنا 50 إعدادًا تمتدّ عبر 27 نموذجًا. ولأن الوكلاء الصوتيين في الإنتاج يعملون بالاستدلال معطّلًا، لأجل زمن الاستجابة، نعرض رؤيتين طوال المقال: الإنتاج (الاستدلال معطّل، ما يعمل على المكالمات الحية) والأفضل (استدلال متوسط، سقف يبيّن مقدار ما يمكن أن يوفّره الاستدلال). يتصدّر GPT-5.5 الاثنين، إذ يبلغ 84.8 بالمئة عدم هلوسة في الإنتاج و88.0 بالمئة في أفضل حالاته. لا يوجد نموذج قريب من حلّ المشكلة، وهذا هو المقصود تمامًا.

كيف بنينا مجموعة البيانات

أخذنا عيّنات من حركة المرور الإنتاجية للمكالمات بين 6 فبراير و1 مايو 2026، في نوافذ مدّتها 30 دقيقة تقريبًا كل 15 يومًا، مستمدّة من مؤسسات لديها أكثر من 1,000 مكالمة في الأشهر الثلاثة السابقة. والأهم أننا أخذنا العيّنات على مستوى المؤسسة، بحيث لا تهيمن بضع مؤسسات ذات حجم مرتفع على المجموعة. وهذا ما يبقي التوزيع واسعًا عبر عمليات النشر الحقيقية بدلًا من انحيازه نحو أي عميل واحد.

من تلك الحركة انتقينا مجموعتين من الحالات الصعبة: مجموعة هلوسة من 2,075 حالة ومجموعة استدعاء أدوات من 1,514 حالة. تُستخرج كل حالة عبر خطّ متعدّد المراحل. مصنّفات أولية خفيفة تُعلِّم اللحظات المرشّحة (ادعاءات رقمية، لحظات ما قبل التحويل، أخطاء الأدوات، استدعاءات مكرّرة أو مفقودة)، ثم يؤكّد مصنّف LLM ما إذا كان قد حدث فشل حقيقي ويصنّف فئته وشدّته، وتُعيد مرحلة ثانية فحص اللحظة المحدّدة، وأخيرًا يُولَّد حلّ مرجعي صحيح للتقييم.

تصنيف الأخطاء نفسه مفيد. على جانب الهلوسة، المشكلة السائدة ليست غريبة. يختلق الوكلاء أو يسيئون ذكر السياسة أكثر بكثير من أي شيء آخر.

__wf_reserved_inherit
الشكل 1. فئات الهلوسة عبر 2,075 حالة منتقاة. المصدر: Retell-Eval.

تتجمّع أخطاء استدعاء الأدوات بالإحكام نفسه. من أصل 1,514 حالة، أكبر فئتين هما إغفال استدعاء لازم (897) وإطلاق استدعاء غير ضروري (520). اختيار الأداة الخاطئة يكاد ينعدم (حالتان). بعبارة أخرى، نادرًا ما تختار النماذج الأداة الخاطئة. إنها تفشل في الحُكم: معرفة متى تتصرّف ومتى تتريّث.

كيف نقيّم

يستخدم التقييم مجلس LLM: لجنة من النماذج المتقدّمة الرائدة تقيّم كل حالة مقابل مقياس وصفي وحلّ مرجعي مولّد. استخدام عدة حكّام أقوياء بدلًا من واحد يمنع التقييم من وراثة النقاط العمياء لأي نموذج منفرد، وتُسوّى الخلافات داخل اللجنة.

ولأن الدرجات المطلقة تتغيّر مع المقياس والحكّام، نتعامل مع الترتيب، لا مع الرقم الدقيق، بوصفه الإشارة.

لماذا نقيّم على أصعب اللحظات

أعلى درجة نحو 88 بالمئة، وهذا مقصود بالتصميم. لو قيّمنا على التوزيع الإنتاجي الكامل، لحقّق كل نموذج متقدّم تقريبًا أكثر من 90 بالمئة ولما أخبرتك لوحة الصدارة بشيء. المكالمات السهلة سهلة على الجميع.

لذا فإن vCX-Hard مبنيّ من أصعب اللحظات، اللحظات التي تتباعد فيها النماذج فعلًا. هكذا يعمل كل معيار جادّ. معيار الرياضيات يستخدم مسائل مسابقات، لا العمليات الحسابية التي يكتبها المستخدم النموذجي. الهدف ليس رقمًا مُطريًا. الهدف رقم يمكنك مقارنته عبر النماذج، وعبر الزمن مع صدور نماذج جديدة.

النتائج

نعرض كل لوحة صدارة بطريقتين: الإنتاج، بالاستدلال معطّلًا، وهو ما يعمل على المكالمات الحية، والأفضل، كل نموذج في أقوى إعداد استدلال لديه، وهو ما يبيّن السقف. على عدم الهلوسة، يتصدّر GPT-5.5 الاثنين. في الإنتاج يجلس خطّ GPT-5 وgemini-3.1-pro في القمة؛ وتشغيل الاستدلال يرفع الأسماء نفسها بضع نقاط ويعيد ترتيب المتنافسين خلفها.

__wf_reserved_inherit
الشكل 2. معدّل عدم الهلوسة، أفضل 12 نموذجًا. الإنتاج مقابل الأفضل.

صحّة استدعاء الأدوات هي حيث تتباعد الرؤيتان أكثر. مع تشغيل الاستدلال، يتصدّر GPT-5.5. لكن في الإنتاج، حيث يعمل فعلًا، يهبط استدعاء الأدوات لدى GPT-5.5 من 88.3 إلى 75.6 بالمئة، ويصبح gemini-3.1-pro أفضل مستدعٍ للأدوات بفارق واضح، محتفظًا بـ85.7 بالمئة بالاستدلال معطّلًا. إذا كان وكيلك يعمل بالاستدلال معطّلًا، فإن أقوى نموذج ليس هو نفسه.

__wf_reserved_inherit
الشكل 3. صحّة استدعاء الأدوات، أفضل 12 نموذجًا. الإنتاج مقابل الأفضل.

تبرز ثلاثة أنماط عبر المجموعة الكاملة.

1. الاستدلال هو الفجوة بين الرؤيتين. تشغيل الاستدلال يرفع الدرجات على كل نموذج تقريبًا، بنحو 5 نقاط في المتوسط لعدم الهلوسة. يرتفع GPT-5.5 من 84.8 إلى 88.0 بالمئة بمجرد أن يستدلّ قبل أن يتكلّم. الكلفة هي زمن الاستجابة، ولهذا يتركه معظم الوكلاء الإنتاجيين معطّلًا، ولهذا فإن رؤية الإنتاج هي التي ينبغي التخطيط على أساسها.

__wf_reserved_inherit
الشكل 4. الاستدلال معطّل مقابل متوسط، معدّل عدم الهلوسة.

2. الالتزام والتصرّف مهارتان مختلفتان. المحوران لا يُصنّفان بالطريقة نفسها. نموذج قوي في الالتزام قد يكون متوسطًا في استدعاء الأدوات والعكس صحيح. يحتلّ GPT-5.4 مرتبة قريبة من القمة في الالتزام لكنه خارج العشرة الأوائل في استدعاء الأدوات، بينما claude-4.5-sonnet هو العكس. اختيار نموذج هو في الحقيقة سؤال عن أي فشل لا يقدر عملاؤك على تحمّله.

3. لا يوجد نموذج آمن بعد. حتى في أفضل حالاته لا يزال المتصدّر يخطئ نحو واحدة من كل ثماني من أصعب اللحظات على كل محور، وفي الإنتاج يخطئ أكثر. الفجوة بين درجة معيار وعملية نشر يمكنك الوثوق بها هي بالضبط العمل الذي تؤدّيه المنصّة فوق النموذج.

بالنظر عبر أجيال النماذج، تتحرّك الجبهة في الاتجاه الصحيح. من GPT-4o إلى GPT-5.5، ارتفع عدم الهلوسة من 72.8 إلى 88.0 بالمئة، مع تحسّن استدعاء الأدوات على منحنى مماثل.

__wf_reserved_inherit
الشكل 5. أجيال نماذج OpenAI على vCX-Hard، أفضل إعداد قياسي.

لوحة الصدارة الكاملة

الإنتاج (الاستدلال معطّل، ما يعمل حيًّا) والأفضل (أقوى إعداد استدلال) لكل نموذج، مرتّبة حسب عدم الهلوسة في الإنتاج. الأعلى أفضل.

النموذجعدم الهلوسة %استدعاء الأدوات %
الإنتاج (الاستدلال معطّل)الأفضل (مع الاستدلال)الإنتاج (الاستدلال معطّل)الأفضل (مع الاستدلال)
gpt-5.584.8%88.0%75.6%88.3%
gpt-5.483.0%83.3%75.2%77.4%
gemini-3.1-pro82.6%83.6%85.7%85.9%
gpt-5.281.3%81.6%79.6%81.5%
claude-4.6-sonnet81.2%81.6%80.1%80.4%
glm-5.179.3%82.7%77.3%83.8%
gpt-5.175.7%81.0%78.2%83.7%
gemini-3.1-flash-lite74.4%77.7%69.0%75.8%
gemini-3-flash73.8%80.1%71.2%81.8%
gpt-4o72.8%72.8%63.6%63.6%
claude-4.5-haiku72.4%78.7%70.7%79.4%
gemini-2.5-pro72.3%77.2%72.9%80.6%
gemini-3.5-flash72.0%80.7%69.2%84.0%
claude-4.5-sonnet71.5%80.6%77.5%85.8%
gpt-4.171.5%71.5%62.2%62.2%
gpt-571.2%78.8%68.9%83.2%
gpt-5.4-mini70.7%71.3%57.1%60.2%
gpt-5-mini69.4%75.2%70.6%75.6%
o4-mini67.9%67.9%73.9%73.9%
gpt-5.4-nano66.2%66.3%57.5%59.1%
grok-4.365.8%76.3%54.6%72.1%
kimi-k2.663.5%63.5%66.3%66.3%
o3-mini62.7%62.7%59.0%59.0%
gemini-2.5-flash-lite59.8%75.2%47.0%70.3%
mercury-256.7%61.9%52.2%55.9%
gpt-5-nano53.9%57.6%54.5%56.1%
deepseek-v4-pro49.8%55.6%58.9%64.5%

الإنتاج هو كل نموذج بالاستدلال معطّلًا، أو أدنى إعداد متاح لديه. الأفضل هو أقوى إعداد استدلال لديه. النماذج ذات الأعمدة المتطابقة (gpt-4o وgpt-4.1 وkimi-k2.6 وo4-mini وo3-mini) قُيّم لها إعداد واحد.

من النتائج إلى الإنتاج

المعيار مفيد فقط إذا غيّر الطريقة التي تبني بها. الفجوات التي يكشفها vCX-Hard تنعكس مباشرة على الميزات في منصّة Retell، حتى لا تضطرّ إلى بنائها بنفسك.

  • نموذج LLM لكل عقدة: لا نموذج يفوز في كل مكان. الالتزام والتصرّف مهارتان مختلفتان، وأفضل نموذج على لحظة صعبة يكون مبالغًا فيه على لحظة سهلة. يتيح لك نموذج LLM لكل عقدة توجيه كل خطوة من المحادثة إلى النموذج الصحيح: أقوى نماذجك على أصعب اللحظات وأعلاها مخاطرة، ونموذج أسرع وأرخص على التحيّات والتأكيدات. تدفع مقابل الدقّة من الطراز الأول فقط حيث يهمّ الأمر.
  • التحدّث أثناء الانتظار: استدعاءات الأدوات تستغرق وقتًا. عندما يضطرّ وكيل إلى استخدام API أو البحث عن شيء أثناء المكالمة، قد تترك تلك الرحلة ذهابًا وإيابًا هواءً ميتًا على الخطّ. يبقي التحدّث أثناء الانتظار المتصل منشغلًا بكلام طبيعي بينما يعمل استدعاء الأداة، بحيث لا تبدو الوقفة أبدًا وكأن الخطّ صمت.
  • الالتزام بقاعدة المعرفة: الفشل الأكثر شيوعًا على الإطلاق. اختلاق السياسة والاقتباس الخاطئ من قاعدة المعرفة هما أكبر فئتي هلوسة في المعيار. التزام الوكيل بقاعدة المعرفة الخاصة بك يبقي الإجابات مرتبطة بسياساتك الحقيقية بدلًا من أفضل تخمين للنموذج.
  • اختبار المحاكاة: الحالات التي لا يستطيع هذا المعيار رؤيتها. يعمل vCX-Hard على حركة مرورنا الإنتاجية. أصعب مكالماتك هي مكالماتك أنت. يتيح لك اختبار المحاكاة تشغيل النوع نفسه من التقييم على سيناريوهاتك، بحيث يمكنك اختيار نموذج وضبطه مقابل المكالمات التي تتلقّاها فعلًا.
  • QA بالذكاء الاصطناعي: المعيار يقيّم النماذج، وQA بالذكاء الاصطناعي يقيّم مكالماتك. يعمل vCX-Hard على مجموعة ثابتة؛ وإنتاجك يتغيّر باستمرار. يقيّم QA بالذكاء الاصطناعي باستمرار عيّنة من مكالماتك الحية على المحاور نفسها المهمّة هنا، الهلوسة واستدعاء قاعدة المعرفة ودقّة استدعاء الأدوات، إضافة إلى مقاييس مخصّصة تحدّدها لما يُعدّ مكالمة جيدة.

اختيار النموذج هو الخطوة الأولى. المنصّة المحيطة بالنموذج هي ما يحوّل درجة المعيار إلى عملية نشر يمكنك الوثوق بها.

القيود وما هو التالي

vCX-Hard نسخة مبكرة وله قيود حقيقية. يعتمد التقييم على لجنة حكّام LLM، التي تحمل تحيّزاتها الخاصة. الحالات مستخرجة للصعوبة، لذا تعكس الدرجات أصعب اللحظات بدلًا من متوسط جودة المكالمة. والمعيار يقيس نمطي فشل محدّدين، لا التجربة الكاملة للمكالمة مثل النبرة أو زمن الاستجابة أو التعامل مع المقاطعة.

سنبقي vCX-Hard محدّثًا مع صدور نماذج جديدة. كل إطلاق يثير السؤال نفسه في كل فريق يشغّل وكلاء صوتيين: صدر نموذج جديد، هل نبدّل؟ vCX-Hard مبنيّ للإجابة عن ذلك ببيانات حالية بدلًا من تخمين.

لماذا نشارك هذا

المعايير ليست لجعل الأرقام تبدو جيدة. إنها للمقارنة الصادقة. عندما يتشبّع أحدها، يبني المجال معيارًا أصعب. vCX-Hard هو الطريقة التي نختار بها النماذج داخليًا، والطريقة التي نجيب بها الآن عن السؤال الذي يطرحه العملاء فعلًا، بالأدلّة بدلًا من اسم علامة تجارية. سنبقي نرفع المستوى ما دامت النماذج تفعل ذلك.

ROI Calculator
Estimate Your ROI from Automating Calls

See how much your business could save by switching to AI-powered voice agents.

All done! 
Your submission has been sent to your email
Oops! Something went wrong while submitting the form.
   1
   8
20
Oops! Something went wrong while submitting the form.

ROI Result

2,000

Total Human Agent Cost

$5,000
/month

AI Agent Cost

$3,000
/month

Estimated Savings

$2,000
/month
عرض مباشر
جرّب العرض المباشر

رقم هاتف تجريبي من Retell Clinic Office

شكرًا لك! تم استلام طلبك بنجاح!
عذرًا! حدث خطأ أثناء إرسال النموذج.

Read Other Blogs

Revolutionize your call operation with Retell