ما معنى Mixture of Experts؟ لماذا يعمل نموذج بـ47 مليار معامل كأنه بـ12 مليارًا

تخيّل مستشفى فيه ثمانية أطباء متخصصين، لكن موظف الاستقبال يوجّه كل مريض إلى طبيبين فقط. المستشفى كبير، والمريض الواحد لا يستهلك إلا جزءًا من طاقته. هذه هي فكرة Mixture of Experts (اختصارًا MoE) في النماذج اللغوية.

الفكرة في جملة

بدل أن يشغّل النموذج كل معاملاته لكل كلمة (توكن)، يضم «خبراء» عدة، ومعهم «موجّه» (Router) يختار من يعالج كل توكن. النتيجة نموذج ضخم في الحجم الكلي، خفيف نسبيًا في الحساب.

كيف يعمل من الداخل؟

بحسب شرح Hugging Face، يستبدل MoE طبقات التغذية الأمامية (Feed-forward) في المحوّل (Transformer) بمجموعة شبكات خبيرة. وكل خبير شبكة عادية، والموجّه شبكة متعلَّمة تقرر أي الخبراء يعالج كل توكن. في نموذج Mixtral 8x7B مثلًا ثمانية خبراء في كل طبقة، وكل توكن يذهب إلى اثنين منهم.

نموذج كثيف (Dense) نموذج MoE «خفيف الحساب»
المعاملات المستخدمة لكل توكن كلها جزء منها (الخبراء المختارون)
سرعة الاستنتاج أبطأ عند الحجم نفسه أسرع من كثيف بالحجم الكلي نفسه
الذاكرة المطلوبة بقدر الحجم بقدر الحجم الكلي، أي كل الخبراء

الأرقام التي تفسّر العنوان

نموذج Mixtral يحتاج ذاكرة بطاقة رسومية تكفي نموذجًا بنحو 47 مليار معامل، مع أنه يحسب كأنه نموذج بنحو 12 مليارًا. ولماذا 47 وليس 56 (أي 8 × 7)؟ لأن بعض الطبقات، كالانتباه (Attention)، مشتركة بين الخبراء ولا تُكرَّر.

أين تلاحظه كمستخدم؟

قد لا تلاحظه مباشرة، فالشركات لا تعلن دائمًا هل نموذجها كثيف أم MoE. ما تراه أثره غير المباشر: نموذج كبير بسرعة جيدة وتكلفة استنتاج أقل من نموذج كثيف بالحجم نفسه. ولذلك لا تحكم على الجودة بعدد المعاملات المعلن وحده.

ما الثمن؟

فائدة عملية: حين ترى «نموذجًا بمئات المليارات من المعاملات» بسعر منخفض، قد يكون السبب أن جزءًا صغيرًا فقط يعمل لكل توكن. لكن عدد المعاملات وحده لا يخبرك بالجودة، وإن أردت تشغيله على جهازك فستحتاج الذاكرة الكلية، لا الجزء النشط.

لفهم ما يحيط بهذا المفهوم اقرأ الفرق بين open-weight والمصدر المفتوح فكثير من نماذج MoE المفتوحة الأوزان تدخل فيه، وراجع كيف تمثّل Embeddings المعنى لمعرفة ما يعالجه كل خبير فعليًا.

Exit mobile version