تدمج معظم منصّات الذكاء الاصطناعي الصوتي أربعة عناصر في سعر واحد لكل دقيقة: تحويل الكلام إلى نص، ونموذج اللغة، وتحويل النص إلى كلام، والتنسيق الذي يربطها معًا في مكالمة هاتفية فورية. تأتي الاتصالات الهاتفية عبر SIP، لكن دقائق شركة الاتصالات، والأنظمة التي يتحدث معها وكيلك، ومنطق المحادثة نفسه لا تزال ملكك.
هذه هي الإجابة الكاملة. أمّا بقية هذا الدليل فهو موجّه للمشترين الذين يظلّون عالقين عند السؤال التقييمي نفسه: «مهلًا، هل نحتاج إلى اشتراكات منفصلة للاتصالات الهاتفية وTTS وSTT وLLMs، أم أنّ هذا جزء بالفعل من المنصّة؟»
إذا جلست في مكالمة مع أحد المورّدين تقارن فيها منصّة ذكاء اصطناعي صوتي جنبًا إلى جنب مع Twilio أو ElevenLabs أو OpenAI وسألت أيّها أرخص، فهذه المقالة هي أوضح إجابة ستحصل عليها. هؤلاء المورّدون لا يقعون في العمود نفسه. كلّ واحد منهم يبيع طبقة واحدة من المنظومة. أمّا منصّة مثل Retell AI فتبيع المنظومة المنسّقة بأكملها.
معرفة الطبقة التي تشتريها بأموالك تجيب عن أربعة أسئلة عملية:
كلّ وكيل صوتي يردّ على الهاتف يعمل بالسلسلة نفسها. يدخل الصوت. يُحوَّل إلى نص. يستدلّ نموذج ما على النصّ المكتوب. تُنطق الاستجابة مجددًا. وكلّ ذلك يتدفّق بالتوازي.
| الطبقة | ما تقوم به | المورّدون الشائعون |
|---|---|---|
| الاتصالات الهاتفية | توجيه الصوت بين الهاتف والخادم | Twilio, Telnyx, Vonage, Avaya |
| تحويل الكلام إلى نص (STT) | يحوّل الصوت إلى نصّ | Deepgram, AssemblyAI, Whisper |
| نموذج اللغة (LLM) | يقرأ ويستدلّ ويقرّر ويردّ | GPT-5, GPT-4o, Claude 4.5, Gemini 3.0 |
| تحويل النص إلى كلام (TTS) | يحوّل النصّ إلى صوت منطوق | ElevenLabs, Cartesia, OpenAI, MiniMax |
| التنسيق | يبثّ ويخزّن مؤقتًا ويتعامل مع تبادل الأدوار واستدعاءات الأدوات | منصّة الذكاء الاصطناعي الصوتي |
الأربعة الأولى سلع نمطية. الجميع يستخدم المورّدين أنفسهم تقريبًا. أمّا الخامسة فهي المكان الذي تحرق فيه الفرق بهدوء ثلاثة إلى ستة أشهر من العمل الهندسي عندما تحاول بناءها بنفسها.
التكلفة الخفية لعبارة «سنجمّعها معًا بأنفسنا»: بثّ WebSockets. تخزين مؤقت عند حدود الجمل. اكتشاف النشاط الصوتي. التعافي من المقاطعة. استدعاء الدوال في منتصف المكالمة. منطق إعادة المحاولة عبر أربع واجهات API. تكامل SIP يتعامل مع خصوصيات ترميز 8 kHz. لا شيء من ذلك يأتي جاهزًا خارج الصندوق.
لا. ليس مع منصّة. مع منصّة الذكاء الاصطناعي الصوتي، توقّع اتفاقية واحدة وتحصل على فاتورة واحدة. أمّا مع البنية التحتية الخام، فتوقّع أربعًا.
تظهر ثلاثة مسارات شراء في التقييمات الواقعية:
1. المنصّة المدمجة: عقد واحد، فاتورة واحدة، لوحة تحكّم واحدة. تختار صوتًا ونموذج LLM من القوائم المنسدلة؛ وتتولّى المنصّة الترخيص واستدعاءات API والقياس. هذا ما تختاره معظم الفرق خلال الـ90 يومًا الأولى.
2. البنية التحتية الخام: Twilio + مورّد STT + واجهة LLM API + مورّد TTS، مجمّعة معًا بكود التنسيق الخاصّ بك. أقصى قدر من التحكّم، أربع مجموعات من بيانات الاعتماد، ثلاثة إلى ستة أشهر من العمل الهندسي قبل أن تُجري مكالمة حقيقية.
3. الهجين «أحضر نموذجك الخاص»: تتولّى المنصّة التنسيق والمكوّنات، لكنّك تحضر خطّ SIP الخاصّ بك أو نموذجك المضبوط بدقّة أو مفاتيح الصوت الخاصّة بك. هذا هو المكان الذي تنتهي إليه معظم عمليات النشر الإنتاجية بعد الربع الأول.
يغطّي السعر المعلن للمنصّة التنسيق. أمّا المكوّنات فتضاف فوقه، وهي بنود شفّافة، لا رسوم خفية.
إليك كيف تتوزّع مكالمة نموذجية في السوق المتوسّط على صفحة الأسعار:
| المكوّن | السعر النموذجي | ملاحظات |
|---|---|---|
| التنسيق الأساسي | ~$0.07/دقيقة | ثابت |
| الصوت (Cartesia) | ~$0.05–$0.07/دقيقة | ElevenLabs/OpenAI أعلى |
| LLM | $0.003–$0.08/دقيقة | Gemini Flash الأرخص، GPT-5 الأعلى |
| الاتصالات الهاتفية (مدمجة) | ~$0.015/دقيقة | أو $0 مع خطّ SIP الخاصّ بك |
| الإجمالي (النموذجي) | $0.13–$0.20/دقيقة | صوت متوسّط + نموذج كفء |
ملاحظتان قبل أن تُدرج هذا في نموذجك المالي:
نعم، ونعم. يعتمد ذلك على ما لديك بالفعل.
يمكنك شراء رقم هاتف مباشرة داخل لوحة التحكّم والبدء في تلقّي المكالمات في أقلّ من ساعة. ويمكنك أيضًا إحضار رقم Twilio أو Telnyx أو Vonage أو Avaya موجود مسبقًا عبر SIP trunking وتخطّي شركة الاتصالات المعاد بيعها بالكامل. كلا المسارين يستخدمان طبقة التنسيق نفسها في الأساس.
قاعدة قرار سريعة:
يمكنك التبديل لاحقًا. إعادة استيراد رقم تستغرق دقائق، لا خطط ترحيل.
لا. الصوت الذي تختاره من قائمة منسدلة مشمول في السعر لكلّ دقيقة.
هذا يربك كثيرًا من مكالمات التقييم لأنّ ElevenLabs تبيع منتجين متميّزين:
إذا كنت تستخدم منصّة ذكاء اصطناعي صوتي، فأنت تحصل على #2. لا مفتاح API منفصل. لا اشتراك منفصل. لا فاتورة منفصلة. الترخيص والقياس يحدثان في الواجهة الخلفية.
المنطق نفسه ينطبق على Cartesia وOpenAI TTS وMiniMax والنماذج الصوتية الخاصّة بالمنصّة. الاستثناء الوحيد هو استنساخ الصوت للمؤسسات، الذي يُهيّأ بشكل منفصل للفرق التي تحتاج إلى صوت خاصّ بالعلامة التجارية.
لا. الاستدلال مدمج. تختار النموذج من قائمة منسدلة ويتكيّف السعر لكلّ دقيقة:
لا مفتاح OpenAI API من جانبك. لا حساب Anthropic. لا مشروع Google Cloud.
إذا كنت تريد إحضار نموذجك الخاصّ (أوزان مضبوطة بدقّة، أو عقد OpenAI Enterprise وقّعته بالفعل، أو نشر Llama مستضاف ذاتيًا)، فإنّ المنصّة تدعم WebSocket لنموذج LLM مخصّص. خطوات التكامل موجودة في الوثائق.
متى يصبح إحضار نموذجك الخاصّ هو القرار الصحيح؟
لكلّ من عداك، المسار المدمج أسرع في النشر وأسهل في التبديل عندما يظهر نموذج جديد.
إليك الجزء الذي يفاجئ الفرق. المنصّة تتولّى المحادثة. وأنت تتولّى العمل الذي تخدمه.
| أنت توفّر | المنصّة تتولّى |
|---|---|
| محتوى قاعدة المعرفة (كتالوج خدماتك، الأسعار، الساعات، السياسات) | استرجاع RAG والمزامنة التلقائية |
| نظام CRM وسجلّ البيانات المرجعي | استدعاءات webhook أثناء المحادثة |
| التقويم ونظام الحجز | التحقّق من التوافر الفوري وإنشاء الأحداث |
| تصميم تدفّق المحادثة | إطار السحب والإفلات لبنائه |
| قواعد التصعيد والتوجيه | التحويل المُمهَّد بالسياق الكامل |
بضع ملاحظات تستحقّ الإبراز:
فجوة التكلفة صغيرة. فجوة الوقت هائلة.
| المنصّة المدمجة | البناء بإحضار مكوّناتك الخاصة | |
|---|---|---|
| علاقات المورّدين | 1 | 4+ |
| الوقت حتى أوّل مكالمة مباشرة | أقلّ من ساعة | 3–6 أشهر |
| التكلفة المحمّلة لكلّ دقيقة | $0.13–$0.20 | $0.13–$0.31 |
| العمل الهندسي المطلوب | تصميم الـprompt + التدفّق | خطّ بثّ + منطق إعادة المحاولة + المراقبة + معالجة SIP |
| سلسلة الامتثال | اتفاقية BAA واحدة | واحدة لكلّ مورّد في المنظومة |
يجرّ البناء النموذجي بإحضار مكوّناتك الخاصة Twilio للاتصالات الهاتفية، وDeepgram أو AssemblyAI للتحويل النصّي، وGPT-5 أو Claude 4.5 للاستدلال، وElevenLabs أو Cartesia للصوت، وPipecat أو LiveKit للتنسيق. حسابات التكلفة لكلّ دقيقة تقع في المنطقة نفسها تقريبًا مثل المنصّة المدمجة.
ما تدفع مقابله عند البناء هو الوقت الهندسي. اكتشاف النشاط الصوتي، ومعالجة المقاطعة، واستدعاء الدوال الذي ينجو من الأعطال في منتصف المكالمة، والمراقبة التي تربط أربع لوحات تحكّم للمورّدين في أثر واحد، وتكامل SIP الذي يتعامل بسلاسة مع خصوصيات ترميز 8 kHz لصوت الاتصالات الهاتفية. لا شيء من ذلك يأتي جاهزًا خارج الصندوق.
معظم نماذج التحويل النصّي الحديثة مدرّبة بشكل أساسي على صوت 16 kHz. الاتصالات الهاتفية تسلّمك 8 kHz. فجوة الدقّة في خطّ مبني حديثًا حقيقية وملحوظة للمتّصلين.
تلك الفجوة بين أشهر من السباكة وأيام من هندسة الـprompt هي سبب إطلاق معظم وكلاء الصوت الإنتاجيين في 2026 على منصّة.
Twilio وElevenLabs وOpenAI وRetell AI لا تتنافس على الدولار نفسه. إنّها طبقات مكدّسة في البنية نفسها:
الصياغة الصحيحة نادرًا ما تكون «Retell أو Twilio». إنّها «Retell فوق Twilio». الأمر نفسه مع OpenAI وElevenLabs. التداخل الحقيقي الوحيد يقع عند طبقة التنسيق، وصفحة Retell مقابل ElevenLabs تغطّي تلك المقارنة الأضيق للفرق التي تختار بين منصّة ومنتج ElevenLabs الشامل الخاصّ به.
الامتثال يقع عند طبقة المنصّة. SOC 2 Type II، وHIPAA مع اتفاقية BAA ذاتية الخدمة، وGDPR مشمولة بلا رسوم امتثال إضافية لكلّ دقيقة.
حيث يهمّ هذا أكثر هو البناء غير المدمج. الامتثال لا يتوقّف عند التنسيق في منظومة مجمّعة معًا. كلّ مورّد في السلسلة (STT، LLM، TTS، الاتصالات الهاتفية) له عملية BAA خاصّة به، وشروط معالجة بيانات خاصّة به، وأثر تدقيق خاصّ به. عادةً ما تختار فرق المشتريات في الرعاية الصحية، التأمين، و الخدمات المالية الدمج لهذا السبب وحده.
موافقة مورّد واحد تتحرّك أسرع من أربعة.
ثلاث عمليات نشر تجعل المقايضة ملموسة:
Anker: أتمتة الصوت عبر مراكز الدعم العالمية التي تتعامل مع ملايين المكالمات سنويًا عبر أمريكا الشمالية وأوروبا وآسيا. حقّق الوكلاء دقّة تعرّف على الكلام بنسبة 95%+ في الأسواق الناطقة بالإنجليزية، وهم يعملون فوق الاتصالات الهاتفية الموجودة لدى Anker بدلًا من خطّ بأربعة مورّدين.
Medical Data Systems: عمليات التحصيل عبر المنصّة. الفريق يتعامل الآن مع 100% من المكالمات الواردة بمعدّل تحويل 30% فقط، ويحصّل نحو $280,000 شهريًا. ومعدّل التحويل 30% ذاك قرار تجاري، لا إعداد افتراضي للمنصّة.
Matic Insurance: روبوت مشغّل خارج ساعات العمل يتعامل مع الدعم وتأكيد المواعيد والاستقبال. في الربع الأول، تعامل الروبوت مع نحو 8,000 مكالمة، بمعدّلات ردّ تتفوّق على الأساس الذي يقوده البشر. يجلس الروبوت فوق علاقة Twilio الموجودة لدى Matic.
النمط عبر الثلاثة جميعًا:
هذا هو خطّ الدمج مقابل إحضار مكوّناتك الخاصة في عمليات النشر الإنتاجية الواقعية.
هل أحتاج إلى اشتراك ElevenLabs لاستخدام منصّة ذكاء اصطناعي صوتي؟
لا. الأصوات مضمّنة في السعر لكلّ دقيقة. الاستثناء هو استنساخ الصوت للمؤسسات، الذي يُهيّأ بشكل منفصل.
هل Twilio مطلوب لتشغيل وكيل ذكاء اصطناعي صوتي؟
لا. تدعم معظم المنصّات Telnyx وVonage وAvaya وأيّ شركة اتصالات متوافقة مع SIP عبر الربط المباشر، إضافة إلى أرقامها المدمجة الخاصّة. يهيمن Twilio على النقاش فقط لأنّه شركة الاتصالات الموجودة الأكثر شيوعًا.
هل يمكنني إحضار نموذج LLM الخاصّ بي؟
نعم. نماذج LLM المخصّصة مدعومة عبر تكامل WebSocket، بما في ذلك عقود OpenAI Enterprise، وواجهة Anthropic API، وGemini، والنماذج المستضافة ذاتيًا. تدفع لمورّد نموذجك مقابل الاستدلال وللمنصّة مقابل التنسيق.
كيف يقارن السعر المدمج ببناء ذاتي على Twilio + OpenAI + ElevenLabs؟
التكاليف الإجمالية المحمّلة تقع في النطاق نفسه تقريبًا: بين $0.13 و$0.31 للدقيقة. اقتصاديات الدقيقة الواحدة ليست العامل الحاسم. العامل الحاسم هو الوقت الهندسي الموفّر على طبقة التنسيق، وهو عادةً أشهر.
ما الذي تشمله طبقة التنسيق؟
بثّ الصوت في أجزاء، والتخزين المؤقت عند حدود الجمل بين نموذج اللغة وTTS، وتبادل الأدوار والمقاطعة، واستدعاء الدوال أثناء مكالمة مباشرة، وإعادة المحاولة والتجاوز عبر واجهات API الأساسية، واختبار المحاكاة، والنصوص المكتوبة مع تسجيل المشاعر، ولوحة مراقبة موحّدة.
هل يمكنني استخدام منصّة ذكاء اصطناعي صوتي لـالمكالمات الصادرة على نطاق واسع؟
نعم. تدعم المكالمات المجمّعة الحملات الصادرة بـ20 مكالمة متزامنة مجانية في كلّ حساب. تشمل حالات الاستخدام الشائعة التسويق الهاتفي بالذكاء الاصطناعي، تأهيل العملاء المحتملين، ومتابعة تحصيل الديون، وتذكيرات المواعيد. امتثال TCPA وSTIR/SHAKEN يُهيّأ على مستوى شركة الاتصالات.
ماذا يحدث عندما لا يستطيع الوكيل التعامل مع مكالمة؟
تحويل مُمهَّد بالسياق الكامل للمحادثة. الشخص الذي يستلم يرى النصّ المكتوب والبيانات المنظّمة التي جمعها الوكيل، فلا يكرّر المتّصل نفسه. عتبات التصعيد (محاولات التوضيح الفاشلة، الموضوعات الحسّاسة، طلبات المتّصل الصريحة) تُهيّأ لكلّ وكيل.
هل المنصّة مناسبة للصناعات المنظّمة؟
نعم. SOC 2 Type II، وHIPAA مع اتفاقية BAA ذاتية الخدمة، وGDPR، وإخفاء PII مشمولة. النشر المحلّي متاح للفرق ذات متطلّبات إقامة البيانات الصارمة.
كم يستغرق الانتقال من التسجيل إلى وكيل مباشر؟
معظم الفرق لديها مكالمة اختبار عاملة خلال ساعة ووكيل جاهز للإنتاج خلال أسبوع إلى أسبوعين. تعالج المنصّة أكثر من 50 مليون مكالمة شهريًا عبر أكثر من 3,000 نشاط تجاري، لذا فمسار النشر مطروق جيدًا.
العناصر الأربعة الفورية (الاتصالات الهاتفية، والتحويل النصّي، ونموذج اللغة، وتركيب الصوت) تتحوّل إلى سلع نمطية بسرعة. يستطيع أيّ شخص شراءها. التنسيق الذي يحوّلها إلى مكالمة هاتفية تسمح لعميل بسماعها هو المكان الذي يتراكم فيه العمل الهندسي، وهو سبب استحقاق رسم المنصّة لكلّ دقيقة للدفع في 2026.
أسرع طريقة للشعور بموضع الخطّ هي إجراء مكالمة حقيقية. يشمل التسجيل في Retell AI رصيد استخدام بقيمة $10، وهو كافٍ لنشر وكيل اختبار مقابل رقمك الخاصّ ومراقبة أين تتّصل أنظمتك الموجودة مقابل ما تتولّاه المنصّة من طرف إلى طرف.
من هناك، الخطوة التالية الطبيعية هي أيّ سير عمل يهمّ أكثر:
ابنِ بالرصيد البالغ $10 على retellai.com.
See how much your business could save by switching to AI-powered voice agents.
Total Human Agent Cost
AI Agent Cost
Estimated Savings
رقم هاتف تجريبي من Retell Clinic Office

Start building smarter conversations today.


.avif)
.avif)