تدور نقاشات كثيرة حول نماذج الذكاء الاصطناعي وبُناها، لكن الاهتمام أقل بكثير بالبنية التحتية الأساسية وسلامة البيانات اللتين تحددان في نهاية المطاف ما إذا كان بالإمكان الوثوق بالذكاء الاصطناعي وتدقيقه وتوسيع نطاقه في بيئات المؤسسات.
عمليًا، لا يكون الذكاء الاصطناعي موثوقًا إلا إذا كانت البنية التحتية وخطوط تدفق البيانات التي تدعمه موثوقة، بدءًا من جمع البيانات مرورًا بنقلها والتحقق منها. وهذا هو المجال الذي سيشهد بصورة متزايدة التمايز الحقيقي.
الحقيقة أن الذكاء الاصطناعي يظهر في مواقف ملموسة جدًا: مكالمة تُوجَّه عبر شبكة الهاتف العامة إلى مريض أو نزيل فندق أو عميل ينتظر الخدمة. وعند حدوث تفاعل كهذا، لا يقتصر العامل الحاسم على جودة النموذج، بل يشمل موثوقية البنية التحتية الأساسية.
هذه البنية التحتية هي الاتصالات، وهي على وشك أن تصبح إحدى أكثر طبقات تقنيات المؤسسات أهميةً واستقطابًا للتنافس.
مشكلة الانشغال بحروب النماذج
قد تظن، من طريقة حديث قطاع الذكاء الاصطناعي عن نفسه، أن ما يهم وحده هو نتائج المعايير القياسية ونوافذ السياق والنموذج الأساسي لدى الشركات الناشئة. هذا الطرح ليس خاطئًا تمامًا؛ فقدرات النموذج مهمة. لكنه غير مكتمل على نحو ينطوي على مخاطر، وستفاجئ هذه الفجوة كثيرًا من المؤسسات.
فكّر فيما يحتاج إليه وكيل صوتي يعمل بالذكاء الاصطناعي فعليًا ليعمل في مستشفى أو منطقة تعليمية أو سلسلة فنادق أو شركة بيع بالتجزئة متوسطة الحجم. يحتاج إلى رقم هاتف حقيقي. ويحتاج إلى trunk SIP لنقل الصوت من PSTN إلى المكان الذي يعمل فيه النموذج. كما يحتاج إلى متحكم حدود الجلسات للتعامل مع اجتياز NAT والتفاوض على برامج الترميز ومنع الاحتيال. ويحتاج إلى منطق توجيه متطور بما يكفي لتصعيد المكالمة إلى موظف بشري عندما يبلغ الوكيل حدوده. ويجب أن يعمل كل ذلك ضمن 200 milliseconds of round-trip latency، لأن هذا هو الحد الذي تظل دونه المحادثة الصوتية طبيعية بالنسبة إلى الإنسان. وإذا تجاوزت زمن الاستجابة هذا الحد، بدا الوكيل معطّلًا مهما بلغت درجة ذكائه.
لا شيء من هذه الأمور تبنيه OpenAI أو Anthropic أو Google. فهم يبنون الاستدلال. ويتعين على جهة أخرى بناء خط المعالجة؛ فبناء خط معالجة صوتي جاهز للإنتاج يعمل مع كل مشغّل وكل جهاز وفي كل بيئة تنظيمية أمر بالغ الصعوبة. ويتطلب ذلك سنوات من الخبرة التشغيلية التي لا تنتقل من هندسة البرمجيات. واتضح أن الشركات التي أنجزت ذلك بالفعل ليست هي الشركات المذكورة في TechCrunch.
ستواصل طبقة الذكاء التحسن. وستصبح النماذج أقل تكلفة وأسرع وأكثر قدرة خلال دورة تبلغ نحو 18 months. أما البنية التحتية التي تعمل عليها فلا تتبع المنحنى نفسه.
النمط التاريخي الذي لا يريد أحد تطبيقه هنا
لقد رأينا هذا من قبل. عندما نما الإنترنت في أواخر 1990s، حققت شركات البنية التحتية للتوجيه، مثل Cisco ومزوّدي سعة النطاق وبائعي معدات الشبكات، قيمة مع كل دورة من حروب المتصفحات وتقلبات شركات الإنترنت الناشئة. وعندما انتشر الهاتف المحمول، ظلت الشركات التي تملك الطيف وأبراج الاتصالات ذات قيمة عبر أجيال الهواتف الذكية. وعندما نما الحوسبة السحابية، أصبحت AWS وAzure من بين أكثر الشركات ربحية في العالم، لا ببناء أفضل تطبيق، بل بامتلاك الطبقة التي تعمل عليها كل التطبيقات.
النمط واضح: تتحول طبقة الذكاء إلى سلعة أسرع من البنية التحتية. يتغير التطبيق في الأعلى؛ أما خط المعالجة الذي يمر عبره فيصعب بناؤه واستبداله. ومع ذلك، كلما حدث انتقال جديد في المنصات، ينصبّ النقاش على طبقة الذكاء إلى أن يفوت الأوان للحصول على موقع جيد في طبقة البنية التحتية.
نحن نمر بهذه المرحلة الآن مع وكلاء الذكاء الاصطناعي والصوت.
أين يقع السوق فعليًا
يستحق حجم ما يتشكل هنا الدراسة، لأن الأرقام لا تمثل نموًا تدريجيًا.
كان سوق UCaaS في أمريكا الشمالية يبلغ بالفعل 41 $ B في 2025، ومن المتوقع أن يقترب من الضعف بحلول 2032، وفقًا لـ Mobility Foresights. وفي الوقت نفسه، تنمو اتصالات الشركات الصغيرة والمتوسطة بمعدل سنوي قدره 27,8 % حتى 2030 (Mordor Intelligence)، بينما تتغير أنماط التبني بالسرعة نفسها. ويُعدّ التطبيب عن بُعد مثالًا واضحًا، إذ استخدمه 86 % من الأطباء في 2021، مقارنةً بـ15 % فقط قبل عامين (Market.us / Newstrail).
ثم هناك الرقم الذي يستحق اهتمامًا أكبر مما يحظى به. إذ تسجل المؤسسات زيادة قدرها 53 % في الإيرادات عندما تأتي UCaaS وCCaaS وCPaaS من حزمة متكاملة واحدة (Mordor Intelligence). وهذا لا يعني أن المنتجات المجمّعة أفضل قليلًا فحسب. بل يوضح أنه عندما تُصمَّم البنية التحتية الصوتية وطبقة مركز الاتصال وطبقة الاتصالات القابلة للبرمجة للعمل معًا، تكون النتيجة التجارية تحوّلية.
يمكن لوكيل الذكاء الاصطناعي عندئذٍ الانتقال بسهولة من الأتمتة إلى الموظفين، والتحول من الصوت إلى SMS، واسترجاع سجل المحادثات عبر قنوات متعددة. وهذا يختلف كثيرًا عن تجميع هذه المكونات من ثلاثة بائعين منفصلين. إن تكامل الحزمة هو ما يجعل وكلاء الذكاء الاصطناعي يعملون فعليًا في بيئة الإنتاج.
الصناعات الأربع التي ستثبت ذلك
لا تتقدم جميع القطاعات بالوتيرة نفسها، وفهم هذا التسلسل لا يقل أهمية عن فهم الفرصة نفسها.
| القطاع | حالة الاستخدام الرئيسية | وضعه الحالي | العائق الفعلي |
|---|---|---|---|
| Retail & SMB | موظف استقبال بالذكاء الاصطناعي، تتبّع الطلبات، متابعة برامج الولاء | الآن | لا عوائق تُذكر — قرارات سريعة، ولا أعباء امتثال باستثناء PCI، وعائد استثمار فوري |
| Hospitality | حجز صوتي، خدمات الضيوف، اتصالات بين منشآت متعددة | التالي | منخفض — قرارات على مستوى GM، ولا بيانات خاضعة للتنظيم، وسرعان ما تتضح جدوى الاستثمار |
| Education | تنبيهات الطوارئ، الفصول الهجينة، اتصالات الحضور | التخطيط | دورات ميزانية سنوية، وشهادة FERPA — أبطأ، لكن معدل فقدان العملاء يقترب من الصفر بعد التطبيق |
| Healthcare | توجيه خدمات الرعاية الصحية عن بُعد، وجدولة المرضى، وإدارة المكالمات السريرية | قيد الدراسة | اتفاقيات BAAs بموجب HIPAA، وتكاملات EHR، وعمليات شراء متعددة الأطراف — وسوق بقيمة 9,8 $ B |
قطاعا التجزئة والضيافة هما المجالان اللذان سيُثبت فيهما ذلك قريبًا. يلتقط وكيل صوتي يعمل بالذكاء الاصطناعي في سلسلة مطاعم بالفعل 30 % من المكالمات الواردة التي لم يُردّ عليها، مع عائد استثمار سنوي موثّق قدره 760 %.
هذه أرقام من بيئات الإنتاج، وهذا النوع من العائد على الاستثمار يجعل جميع التقنيات الأخرى تبدو متواضعة بالمقارنة. تجري عمليات النشر هذه الآن؛ فهي تعمل، وتبني خط الأساس الذي سيجعل النقاشات في قطاعي الرعاية الصحية والتعليم أسهل بكثير خلال 12 months.
الرعاية الصحية مسار طويل وهي الأهم. دورة المبيعات مؤلمة حقًا؛ إذ تشمل اتفاقيات الشريك التجاري HIPAA (BAA)، ومراجعات أمن تقنية المعلومات السريرية، ومتطلبات تكامل EHR، ولجان شراء تضم أطباء ومسؤولين إداريين ومسؤولي امتثال لا يتفقون دائمًا.
هذه العقبات حقيقية، لكنها أيضًا السبب في أن مؤسسة الرعاية الصحية، بمجرد نشرها بنية تحتية صوتية متوافقة مع المتطلبات التنظيمية ومدعومة بالذكاء الاصطناعي، نادرًا ما تتخلى عنها. أعمال الامتثال التي أنجزتها مع المزوّد والتكاملات المدمجة في سير العمل السريري تُشكّل تكاليف انتقال تتراكم لتصبح شبه دائمة. الرعاية الصحية ليست المكسب الأول. إنها الأكثر قيمة.
التعقيد التنظيمي الذي يبدو عائقًا من الخارج يشكّل حاجزًا تنافسيًا من الداخل. كل شهادة HIPAA، وكل تدقيق FERPA، وكل مراجعة PCI‑DSS يجتازها مزوّد البنية التحتية الصوتية تمثّل أمرًا إضافيًا يتعيّن على المنافس تكراره قبل أن يُؤخذ في الحسبان أصلًا. معظمهم لا يكترثون بذلك.
الجزء من القصة الذي تعرفه فرق الهندسة بالفعل
هناك تفصيل حول كيفية بناء وكلاء الصوت بالذكاء الاصطناعي فعليًا اليوم، لا تتناوله الصحافة الاقتصادية، لكن كل من يعمل في هذا المجال يصادفه فورًا.
يتضمن أحد الأساليب الشائعة لربط نماذج اللغة الكبيرة بالمكالمات الهاتفية الحقيقية اليوم استخدام أطر عمل مثل Asterisk، وهو إطار عمل مفتوح المصدر مجرّب وعالي القابلية للتكيّف. وعند استخدامه مع تقنيات مثل OpenAI Realtime API وGoogle Gemini Live وDeepgram، يوفّر Asterisk وسيلة مرنة وموثوقة لربط الصوت المُنشأ بالذكاء الاصطناعي بمكالمات PSTN. وتتيح واجهته AudioSocket، مثلًا، البث في الوقت الفعلي بين نماذج الذكاء الاصطناعي والمكالمات المباشرة، ما يجعله خيارًا قويًا للمطورين الذين يبنون أنظمة صوتية بالذكاء الاصطناعي.
هناك منظومة متنامية من مشاريع مفتوحة المصدر ومجتمعات المطورين التي تبني أطر عمل لوكلاء صوتيين بالذكاء الاصطناعي جاهزة للإنتاج على Asterisk. يكتسب هذا النهج زخمًا لأنه يمنح المطورين التحكم في معالجة المكالمات وتوجيه الوسائط ومنطق التكامل، بطرق تُجرّد منها كثير من المنصات الأعلى مستوى.
وهذا مهم استراتيجيًا بسبب ما يحدث عندما يوحّد مجتمع المطورين جزءًا من البنية التحتية. يتبع اعتماد المؤسسات اعتماد المطورين بنحو 18 إلى 24 شهرًا. المهندسون الذين يبنون اليوم أنظمة صوتية للذكاء الاصطناعي على Asterisk هم المهندسون المعماريون الذين سيحددون البنية التحتية لعمليات النشر المؤسسية في 2027. أما Sangoma، الشركة التي قادت Asterisk خلال العقدين الماضيين، فلديها أعمق علاقة بمجتمع المطورين هذا وأقوى تأثير في التوجه المستقبلي للإطار؛ وهي ليست شركة ناشئة. إنها المؤسسة نفسها التي بنته.
بنت Red Hat نشاطًا تجاريًا استثنائيًا من خلال فعل ذلك بالضبط مع Linux. وفعلت Elastic الشيء نفسه في مجال البحث. يشكّل التفوق التنافسي القائم على المصادر المفتوحة أحد أكثر أشكال الميزة التنافسية استدامة في مجال التكنولوجيا، تحديدًا لأنه لا يعتمد على احتجاز العملاء. فهو متجذر بعمق في طريقة بناء الناس للأنظمة، إلى درجة أن الانتقال إلى بديل يتطلب البدء من الصفر.
ما ينبغي للمؤسسات فعله الآن
إذا كنت قائدًا في مجال التكنولوجيا أو العمليات وتدرس نشر وكلاء الذكاء الاصطناعي، فالسؤال الذي ينبغي طرحه ليس أي نموذج يجب استخدامه، بل ما إذا كانت البنية التحتية الصوتية التي تبني عليها جاهزة للإنتاج، ومعتمدة للامتثال لمتطلبات قطاعك، وقادرة على تحمّل زيادة قدرها 5× في حجم المكالمات عند بدء التشغيل.
تفشل معظم مشاريع الصوت المدعوم بالذكاء الاصطناعي التي تتعثر في بيئة الإنتاج على مستوى البنية التحتية. كان النموذج متينًا. وكان زمن الاستجابة مقبولًا في الاختبار. وبدت وثائق الامتثال كافية. ثم اختبرت بيئة سريرية حقيقية، أو سلسلة متاجر متعددة المواقع، أو منطقة تعليمية تضم 40 000 طالب النظام بطرق لم يُصمَّم التكامل لمواجهتها، فانهار كل شيء.
هناك بُعد آخر تتجاهله معظم النقاشات حول وكلاء الذكاء الاصطناعي تمامًا. عندما يتواصل وكيل ذكاء اصطناعي مع إنسان، أو على نحو متزايد مع وكيل ذكاء اصطناعي آخر، يُنشئ كل تفاعل من هذه التفاعلات سجلًا من البيانات الحساسة التي يجب التحقق من هويتها وختمها زمنيًا وتأمينها عبر حزمة الاتصالات بأكملها. من الذي تحدث. ومتى. وما الذي قيل. وهل كان الصوت على الخط فعلًا لمن ادّعى أنه هو. وهل تم اعتراض البيانات المتبادلة بين الوكلاء أو تغييرها أثناء النقل. هذه ليست حالات استثنائية. بل هي المتطلبات الأساسية لأي تطبيق صوتي للذكاء الاصطناعي في بيئة خاضعة للتنظيم، ويصبح ضمانها أصعب أضعافًا مضاعفة عندما تجمع شركة الصوت من مورّد، والمراسلة من مورّد آخر، والفيديو من ثالث، وأمن الشبكة من رابع.
لا يملك أي طرف في هذا الإعداد سلسلة المسؤولية من البداية إلى النهاية. ولا يستطيع أحد ضمان مكان تخزين البيانات، أو من تعامل معها، أو ما إذا كان سجل التدقيق يصمد أمام مراجعة HIPAA أو تحقيق في خرق. لا تغطي شهادة الامتثال المعلّقة على جدار مورّد واحد سوى الجزء الخاص بذلك المورّد. أما الثغرات بين المورّدين، وعمليات التسليم، واستدعاءات API، والبيانات المنقولة بين المنصات، فلا تقع ضمن مسؤولية أي طرف. في هذه الفجوة في المساءلة تحدث الاختراقات، وتتراكم المخاطر التنظيمية، وتخفق عمليات نشر وكلاء الذكاء الاصطناعي بصمت في تلبية متطلبات الثقة التي لا يستطيع عملاء المؤسسات والرعاية الصحية التنازل عنها.
إن وجود مزوّد واحد موثوق يملك الحزمة بأكملها، بما فيها الصوت والمراسلة والفيديو والشبكات والأمن، لا يسهّل الشراء فحسب. بل يغلق فجوة المساءلة بالكامل، ويمنح المؤسسات سلسلة عهدة واحدة لكل تفاعل، ويجعل الامتثال مضمونًا بنيويًا بدلًا من تجميعه يدويًا عبر عقود مع مورّدين يتنصل كل منهم من مسؤولية ما يحدث خارج نطاقه. وتُعد Sangoma من المزوّدين القلائل جدًا في السوق القادرين على تقديم هذا الضمان، لأنها بنت الحزمة بأكملها بنفسها.
المؤسسات التي تنجح هي التي تعاملت مع البنية التحتية الصوتية بوصفها قرارًا معماريًا أساسيًا، لا مجرد عملية شراء لتوفير الراحة. واختارت مورّدين لديهم التزامات SLA بمستوى شركات الاتصالات، وشهادات امتثال سارية لقطاعها، وخبرة تشغيلية فعلية في الحفاظ على جودة الصوت على نطاق واسع. ثم بنت طبقة الذكاء الاصطناعي فوق هذه الأسس، لا العكس.
من المرجح أن تكون المهلة المتاحة لاتخاذ هذا القرار بتروٍ، قبل أن يفرض الضغط التنافسي خيارًا متسرعًا، من 12 إلى 18 شهرًا. بعد ذلك، ستكون لدى المؤسسات التي جهّزت البنية التحتية على نحو سليم مبكرًا عمليات نشر مرجعية، واستثمارات امتثال تراكمية، وقواعد مثبتة سيستغرق منافسوها سنوات لمحاولة إزاحتها.
يُبنى اقتصاد وكلاء الذكاء الاصطناعي الآن. وكما هو الحال مع كل تحول سابق في المنصات، ستكون طبقة البنية التحتية أهم، ولمدة أطول، من طبقة الذكاء التي يناقشها الجميع حاليًا.
في Sangoma، نبني هذه البنية التحتية منذ أكثر من 40 years، قبل وقت طويل من أن يصفها أحد بأنها AI‑ready. ما نراه الآن هو أن السوق يلحق أخيرًا بما كانت طبقة الصوت قادرة على فعله دائمًا. وهذا لا يجعلنا مطمئنين، بل يزيدنا تركيزًا!
