تخيّل مستشفى فيه ثمانية أطباء متخصصين، لكن موظف الاستقبال يوجّه كل مريض إلى طبيبين فقط. المستشفى كبير، والمريض الواحد لا يستهلك إلا جزءًا من طاقته. هذه هي فكرة Mixture of Experts (اختصارًا MoE) في النماذج اللغوية.
بدل أن يشغّل النموذج كل معاملاته لكل كلمة (توكن)، يضم «خبراء» عدة، ومعهم «موجّه» (Router) يختار من يعالج كل توكن. النتيجة نموذج ضخم في الحجم الكلي، خفيف نسبيًا في الحساب.
كيف يعمل من الداخل؟
بحسب شرح Hugging Face، يستبدل MoE طبقات التغذية الأمامية (Feed-forward) في المحوّل (Transformer) بمجموعة شبكات خبيرة. وكل خبير شبكة عادية، والموجّه شبكة متعلَّمة تقرر أي الخبراء يعالج كل توكن. في نموذج Mixtral 8x7B مثلًا ثمانية خبراء في كل طبقة، وكل توكن يذهب إلى اثنين منهم.
| نموذج كثيف (Dense) | نموذج MoE «خفيف الحساب» | |
|---|---|---|
| المعاملات المستخدمة لكل توكن | كلها | جزء منها (الخبراء المختارون) |
| سرعة الاستنتاج | أبطأ عند الحجم نفسه | أسرع من كثيف بالحجم الكلي نفسه |
| الذاكرة المطلوبة | بقدر الحجم | بقدر الحجم الكلي، أي كل الخبراء |
الأرقام التي تفسّر العنوان
نموذج Mixtral يحتاج ذاكرة بطاقة رسومية تكفي نموذجًا بنحو 47 مليار معامل، مع أنه يحسب كأنه نموذج بنحو 12 مليارًا. ولماذا 47 وليس 56 (أي 8 × 7)؟ لأن بعض الطبقات، كالانتباه (Attention)، مشتركة بين الخبراء ولا تُكرَّر.
أين تلاحظه كمستخدم؟
قد لا تلاحظه مباشرة، فالشركات لا تعلن دائمًا هل نموذجها كثيف أم MoE. ما تراه أثره غير المباشر: نموذج كبير بسرعة جيدة وتكلفة استنتاج أقل من نموذج كثيف بالحجم نفسه. ولذلك لا تحكم على الجودة بعدد المعاملات المعلن وحده.
ما الثمن؟
- ذاكرة كبيرة: يجب تحميل كل الخبراء حتى لو لم يُستخدم إلا اثنان.
- ضبط أدق أصعب: يشير الشرح إلى أن الضبط الدقيق قد يؤدي إلى فرط التخصيص، وأن ضبط التعليمات يخفف المشكلة.
- مناسب لمن؟ تنصح المدونة بـ MoE للإنتاجية العالية على أجهزة كثيرة، وبالنماذج الكثيفة حيث الذاكرة محدودة وحركة الطلبات قليلة.
لفهم ما يحيط بهذا المفهوم اقرأ الفرق بين open-weight والمصدر المفتوح فكثير من نماذج MoE المفتوحة الأوزان تدخل فيه، وراجع كيف تمثّل Embeddings المعنى لمعرفة ما يعالجه كل خبير فعليًا.





