كيفية بناء وكيل صوتي جيد

كيفية بناء وكيل صوتي جيد
BACK TO BLOGS
ON THIS PAGE
Back to top

مع تقدّم الذكاء الاصطناعي التوليدي، شهدنا نموًا كبيرًا في منتجات روبوتات المحادثة التي تهيمن على السوق. وفي الوقت نفسه، تحسّن الذكاء الاصطناعي الصوتي إلى درجة أصبحت فيها المحادثات السلسة مع الذكاء الاصطناعي ممكنة الآن. وسواء كنت تبني ذكاءً اصطناعيًا للمكالمات الواردة والصادرة، أو الخدمات المهنية، أو تطبيقات المرافقة، وما إلى ذلك، يبقى الصوت جزءًا أساسيًا من التجربة ومهمًا للتحويل. يمكننا جميعًا تذكّر تجارب محبطة مع الذكاء الاصطناعي أثناء المكالمات — أصوات آلية، وفترات صمت محرجة، وأزمنة استجابة طويلة، والحاجة إلى الضغط على أزرار للتفاعل، وهي أمور تقلّل مجتمعةً من الجودة الشبيهة بالبشر للتجربة وتزعج المستخدمين أحيانًا.

ما الفرق بين الذكاء الاصطناعي الصوتي والإنسان؟

قبل أن نتطرّق مباشرةً إلى كيفية بناء تجربة صوتية رائعة، لنتوقّف لحظة لنستعرض كيف يتفاعل الإنسان عادةً في المحادثة. نحن نعمل بزمن استجابة أقل من <200 مللي ثانية عند تبادل الأدوار، ونقدّم إشارات دعم صوتية عند الحاجة، وندرك دون وعي متى ينهي الطرف الآخر دوره، ونفهم معنى ومشاعر الطرف الآخر، ولدينا كلمات حشو داخل جملنا، ونتوقّف عن الكلام عند المقاطعة... القائمة قد تطول، لكن النقطة الجوهرية التي أوضّحها هنا هي أن هناك آليات صغيرة كثيرة تحدث خلف الكواليس عندما نجري محادثة بسيطة وسلسة، ومن الصعب للغاية على الآلات أن تراعي كل هذه الأمور وأن تؤدّي مثل البشر.

لماذا يصعب بناء ذكاء اصطناعي صوتي حواري جيد؟

أحد الأسئلة الشائعة التي تُطرح علينا كثيرًا هو لماذا يجب عليّ استخدام Retell API --ألا يمكنني ببساطة دمج ASR (تحويل الكلام إلى نص) وLLM وTTS (تحويل النص إلى كلام) معًا لبناء محادثة صوتية؟

حسنًا، هممم، عليك تمامًا أن تفعل ذلك إن كان لديك الوقت، ولترى إلى أيّ مدى يمكن أن يوصلك نهج الدمج البسيط. المشكلة الأولى التي نسمعها ممن يبنون نظامهم الصوتي الخاص هي أنه من الصعب خفض زمن الاستجابة؛ والمشكلة الثانية التي نراها هي أن معالجة المقاطعة يصعب تنفيذها بإعداد بسيط؛ والمشكلة الثالثة التي نراها هي أن ردّ الوكيل ليس حواريًا بما يكفي ليبدو مثل الإنسان. لمعالجة كل هذه الأمور، لنستعرض لمحة عامة عن المكوّنات التي يجب أن تكون موجودة والعمل الذي يجب القيام به لتحقيق تجربة ذكاء اصطناعي صوتي حواري جيدة.

1. التكامل مع واجهة الويب الأمامية أو أدوات الاتصال القابلة للبرمجة مثل Twilio وVonage للحصول على صوت المستخدم.

2. العمل مع بايتات الصوت وبروتوكولات البث: سيأتي صوت المستخدم من واجهات أمامية مختلفة (الويب، المكالمة الهاتفية) بترميزات وتنسيقات مختلفة، وسيُرسَل عبر بروتوكولات بث مختلفة. هذه مهمة شاقة، إذ يصعب التعامل مع بايتات الصوت وتستغرق وقتًا طويلاً. اسأل أي مهندس تعرفه يعمل مع الإشارات الصوتية؛ سيشاركك القول نفسه.

3. فهم الصوت: هناك إشارات متنوّعة من الصوت حيوية لإجراء محادثة سلسة.

  • النص: يُولَّد عادةً من ASR (التعرّف غير المتزامن على الكلام)، ويجب أن يكون بثًا مباشرًا، وأن يكون سريعًا ودقيقًا قدر الإمكان.
  • العاطفة: فهم الحالة العاطفية للطرف الآخر حيوي للبشر لتقديم ردّ جيد في المحادثة.
  • جودة الإشارة الصوتية: ما إذا كان هناك ضوضاء خلفية، أو صدى.
  • فصل المتحدّثين: إذا كان عدة أشخاص يتحدّثون، حدّد هوية المتحدّث، وحدّد من يتحدّث إليك ومن لا يفعل، وما إلى ذلك.
  • نبرة الصوت وسمات أخرى خاصة بالمتحدّث.
  • التوقّف: ما إذا كان المستخدم يتوقّف عن الكلام، ويُستنتج عادةً من VAD (كشف النشاط الصوتي).

4. تحديد ما إذا كان ينبغي التحدّث: فهم ما إذا كان الطرف الآخر سينهي دوره قريبًا، أو أنه أنهى دوره بالفعل، وما إذا كان ينتظر ردًا أو مجرّد يتوقّف لصياغة أفكاره، وما إلى ذلك. يحتاج إلى الجمع بين النص والعاطفة ونبرة الصوت والتوقّف وغيرها من المدخلات الصوتية لتوليد هذا القرار.

  • الجزء الصعب هو أن المستخدمين يمكن أن ينهوا كلامهم في أي مكان عندما لا تعرفهم جيدًا شخصيًا، وعلى الذكاء الاصطناعي أن يكون مستعدًا لتلك النهايات المفاجئة.
  • استمرار المستخدمين في الكلام بشكل غير متوقّع مشكلة أقل، إذ يمكن للذكاء الاصطناعي ببساطة أن يواصل الاستماع ويتراجع عن قرار التحدّث.

5. توليد الردود: توليد ردّ جيد على ما قاله المستخدم أمر صعب، وخاص جدًا بكل سيناريو. هناك طرق متنوّعة للقيام بهذا الجزء وهو مخصّص لكل حالة استخدام، لذا سأشارك هنا مجرّد تدفّق بسيط لتوليد الردود.

  • RAG (التوليد المعزّز بالاسترجاع): يضمّن المستندات والبيانات وقاعدة المعرفة وما إلى ذلك في قاعدة بيانات متّجهة ويسترجع المعلومات ذات الصلة فقط منها. ستكون هذه المعلومات ذات الصلة جزءًا من prompt الذي يُغذّى في LLM.
  • LLM: يمكن أن يكون هذا نموذجًا مُدرَّبًا بدقة ومُستضافًا ذاتيًا، أو استدعاءات API لمزوّدي الخدمة. استنادًا إلى المعلومات ذات الصلة من الخطوة الأخيرة وبعض prompts الأخرى المخصّصة للمستخدم، ولّد ردًا، وابثّ الرد مرة أخرى إلى نظام توليد الصوت.
  • التحقّق: بالنسبة لعبارات/كلمات معيّنة عالية المخاطر، ربما تحقّق قبل البثّ مرة أخرى.

6. توليف الصوت: يتحقّق عادةً باستخدام نماذج TTS (تحويل النص إلى كلام)، حوّل نص الرد إلى صوت. يحتاج إلى وجود تنوّع في النبرة والعاطفة يناسب السيناريو ليكون شبيهًا بالبشر. من الناحية المثالية، ينبغي بثّ مخرجات TTS مرة أخرى لتقليل زمن الاستجابة.

7. اتخاذ الإجراءات: الذكاء الاصطناعي الذي يستطيع التحدّث رائع، والذكاء الاصطناعي الذي يستطيع اتخاذ الإجراءات أروع. يتحقّق هذا عادةً بوظائف استدعاء الدوال في نماذج معيّنة، أو إخراج بيانات مُهيكلة، بحيث يمكن للنظام اللاحق حجز المواعيد عند الحاجة، والبحث عن المعلومات عند الاقتضاء.

  • عند اتخاذ الإجراءات، تأكّد من أن وكيلك لا يزال قادرًا على الاستجابة.
  • من حالات الاستخدام المحدّدة لهذا هو تحويل المكالمة أو إنهاء المكالمة.

ماذا يمكن أن تفعله Retell AI لتحقيق ذكاء اصطناعي صوتي حواري جيد؟

أعتقد أنه بحلول الآن، سيتّفق معظم الناس على أن هذا ليس بسهولة دمج ASR وLLM وTTS معًا. لذا، دعني (بلا خجل) أقدّم كيف يمكن أن تساعد منصّة Retell AI هنا. من خلال التكامل مع Retell AI، يمكنك توفير أشهر من التطوير، والتمتّع بتجربة صوتية متطوّرة، والحصول على كل ما يلي مغطّى:

  • زمن استجابة منخفض: نطبّق تحسينات في كل خطوة، فيُخفَّض زمن الاستجابة إلى أدنى حدّ للجزء الصوتي. لاحظ أن جزء توليد الردود لا يزال بين يديك، لذا فإن سيطرتنا عليه ضئيلة. عرضنا التوضيحي يبلغ نحو 800 مللي ثانية بين توقّف المستخدم واستجابة الوكيل.
  • معالجة المقاطعة: يمكن للمستخدم المقاطعة في أي وقت، ويتفاعل الوكيل مع ذلك بسرعة فائقة مثل إنسان حقيقي.
  • تكامل الصوت: يمكننا الاتصال مباشرةً مع Twilio، وقد جعلنا كود واجهة الويب الأمامية مفتوح المصدر.
  • العمل مع بايتات الصوت: لقد تكفّلنا بذلك ويمكننا توفير مئات الساعات عليك.
  • فهم الصوت: نستخرج الرؤى من الصوت بأقل زمن استجابة ونرسل إليك نصوصًا فورية (إشارات أخرى قادمة قريبًا).
  • قرار متى يتحدّث: لدينا نموذجنا الخاص لتبادل الأدوار وسنواصل تحسينه لاتخاذ قرارات أفضل بشأن متى يتحدّث.
  • توليف الصوت: نتكامل مع مزوّدي TTS متنوّعين ووظّفنا ممثّلي صوت لإنشاء أصوات شبيهة بالبشر مناسبة للمحادثة.
  • عرض توضيحي ولوحة تحكّم سريعة: أعددنا لوحة التحكّم لدينا لدعم بناء عرض توضيحي في غضون دقيقتين.
  • خبرة متخصّصة ودعم: لدينا خبرة متخصّصة في الصوت والنمذجة وإنشاء الوكلاء. نحن هنا للمساعدة كلما واجهت مشاكل.

ما تحتاج إلى فعله: واصل تحسين منتجك الأساسي لجعله أفضل، بينما نتكفّل نحن بالجزء الصوتي. إليك الأجزاء التي تحتاج إلى العمل عليها:

  • توليد الردود: رغم أننا ندعم إنشاء العرض التوضيحي على لوحة التحكّم، ندرك أن عملية توليد الردود يمكن أن تختلف اختلافًا جذريًا لكل سيناريو. لذلك، ستتكامل واجهة API الخاصة بنا بسهولة مع حل توليد الردود المخصّص الخاص بك، سواء كان استدعاء OpenAI بسيطًا أو إعداد وكيل معقّدًا.
  • اتخاذ الإجراءات: لكي يتّخذ الوكيل الصوتي إجراءً، من المحتمل أن تضطر إلى التكامل مع أدوات مختلفة (التقويمات وCRM وما إلى ذلك). الأمر متروك لك لتقرّر متى تتّخذ الإجراء، وما الذي تتّخذه. لا تنسَ الاستمرار في توليد الردود أثناء اتخاذ الإجراءات.
  • منطق المكالمة المحدّد: ستُحوّل حالات الاستخدام المختلفة المكالمات / تُنهيها بشكل مختلف، والأمر متروك لك لتقرّر التفاصيل حول تدفّق المكالمة. يمكن إعداد هذا عبر استدعاء الدوال.

آمل أن تمنحك هذه المدوّنة فكرة عامة عن كيفية بناء وكيل صوتي رائع، وآمل (بلا خجل) أن يلقي عرضي التقديمي لـ Retell AI الضوء على كيف يمكننا المساعدة.

بناءً موفّقًا!

ROI Calculator
Estimate Your ROI from Automating Calls

See how much your business could save by switching to AI-powered voice agents.

All done! 
Your submission has been sent to your email
Oops! Something went wrong while submitting the form.
   1
   8
20
Oops! Something went wrong while submitting the form.

ROI Result

2,000

Total Human Agent Cost

$5,000
/month

AI Agent Cost

$3,000
/month

Estimated Savings

$2,000
/month
عرض مباشر
جرّب العرض المباشر

رقم هاتف تجريبي من Retell Clinic Office

شكرًا لك! تم استلام طلبك بنجاح!
عذرًا! حدث خطأ أثناء إرسال النموذج.

Read Other Blogs

Revolutionize your call operation with Retell