وأوضح خليط من الخبراء ببساطة
يقوم نموذج خليط من الخبراء بتوجيه كل رمز عبر كتل متخصصة مختارة، مما يؤدي إلى تنشيط جزء فقط من شبكة كبيرة - ولكن قصة الكفاءة بها محاذير.

يحتوي نموذج خليط الخبراء، أو MoE، على العديد من كتل الشبكات العصبية المتخصصة وجهاز توجيه يختار أي منها يتعامل مع كل رمز مميز. بدلاً من تنشيط كل معلمة لكل خطوة، فإنه يستخدم مجموعة فرعية محددة فقط. يتيح ذلك للنموذج أن يتمتع بسعة إجمالية كبيرة دون دفع التكلفة الحسابية الكاملة لنموذج كثيف له نفس الحجم الإجمالي على كل رمز مميز.
لا تعني وزارة التعليم أن "العديد من أنظمة الذكاء الاصطناعي الكاملة تناقش الإجابة"، ولا تجعل الحساب مجانيًا. لا يزال يتعين تخزين الخبراء في الذاكرة، ويتطلب التوجيه جهدًا، ويمكن أن يؤدي نقل الرموز المميزة بين الشرائح إلى زيادة تكلفة الاتصال. تعد المعلمات النشطة وتخطيط الأجهزة والاستخدام وطول المخرجات أكثر أهمية من إجمالي العنوان وحده.
فكر في ورشة عمل مع تناول مشترك
تخيل ورشة عمل بها العديد من المقاعد المتخصصة. كل عنصر يدخل من خلال نفس مكتب الاستقبال. يقوم المرسل بفحصها وإرسالها إلى مقعد أو مقعدين يعتبرهما أكثر فائدة. تمتلك ورشة العمل بأكملها العديد من الأدوات، ولكن يتم استخدام مجموعة صغيرة فقط لهذا العنصر.
في محول MoE، لا تزال الأجزاء المشتركة من الشبكة تعالج كل رمز مميز. في طبقات معينة، يقوم جهاز التوجيه بتسجيل الخبراء المتاحين ويختار القليل منهم. عادةً ما يكون هؤلاء الخبراء عبارة عن كتل مغذية بدلاً من نماذج كاملة بمهن يمكن للإنسان قراءتها. أحد الخبراء ليس "خبير الشعر" بشكل موثوق، وآخر "خبير الرياضيات"، حتى لو ظهر التخصص أثناء التدريب.
يتم دمج المخرجات المحددة وتستمر المعالجة. ويحدث القرار بشكل متكرر، غالبًا لكل رمز مميز وعلى عدة طبقات، لذلك يمكن للكلمات المتجاورة أن تتخذ مسارات مختلفة.
تعتبر اختيارات جهاز التوجيه رقمية وليست تسليمًا واعيًا. يتعلم الخبراء من خلال التدريب، وقد تتداخل أدوارهم أو يصعب على الأشخاص تفسيرها بشكل واضح.
تستهلك النماذج الكثيفة والمتفرقة السعة بشكل مختلف
يستخدم نموذج اللغة الكثيفة على نطاق واسع نفس مجموعة المعلمات لكل رمز مميز. تؤدي زيادة عدد المعلمات بشكل عام إلى زيادة حركة الحساب والذاكرة المطلوبة في كل خطوة إنشاء. يمكن لوزارة التعليم المتفرقة زيادة إجمالي المعلمات مع الحفاظ على المجموعة الفرعية النشطة مستقرة نسبيًا.
ال تبديل ورقة المحولات قامت بتبسيط هذه الفكرة من خلال توجيه كل رمز مميز إلى خبير واحد في طبقات وزارة التعليم الخاصة بها. أفادت تجاربها أن التدريب المسبق كان أسرع من نماذج المقارنة الكثيفة في ظل ظروف المؤلفين. توضح هذه النتائج إمكانات الهندسة المعمارية. فهي ليست نسبة طاقة عالمية لمنتجات الدردشة الحالية.
يشرح هذا التمييز سبب كون إجمالي عدد المعلمات مضللاً. قد تقوم وزارة التعليم المُعلن عنها على أنها كبيرة جدًا بإجراء عمليات حسابية على معلمات أقل بكثير لكل رمز مميز. لكن الخبراء غير النشطين ما زالوا يشغلون ذاكرة التسريع وقد يحتاجون إلى الانتشار عبر الأجهزة.
تحتاج أرقام المعلمات النشطة إلى سياق أيضًا. لا يزال الاهتمام المشترك وطبقات التضمين قيد التشغيل، وبالتالي فإن أوزان الخبراء المحددة لا تمثل بالضرورة عبء العمل النشط بالكامل للنموذج.
يجب على جهاز التوجيه أن يبقي الخبراء مشغولين
إذا أرسل جهاز التوجيه معظم الرموز المميزة إلى نفس الخبير، فسيصبح هذا الخبير في قائمة الانتظار بينما يظل الآخرون في وضع الخمول. ولذلك يستخدم التدريب آليات التوازن التي تشجع حركة المرور على الانتشار بين الخبراء. تقوم الأنظمة أيضًا بتعيين حدود السعة لعدد الرموز المميزة التي يقبلها الخبير في الدفعة.
يمكن أن يكون التوجيه غير مستقر في وقت مبكر من التدريب. قد يتعلم الخبراء وظائف مماثلة أو قد يتلقى البعض بيانات قليلة جدًا. يقوم المهندسون بضبط الخسائر الإضافية والسعة والضوضاء والموضع لتحسين التوازن دون الإضرار بجودة النموذج.
تضيف الخدمة مشكلة جسدية: قد يعيش الخبراء المختارون على مسرعات مختلفة. تنتقل الرموز بعد ذلك عبر شبكة عالية السرعة بين الطبقات المشتركة والكتل المتخصصة. يمكن أن يحد الاتصال من السرعة ويزيد من الطاقة، خاصة مع الدفعات الصغيرة أو الوضع السيئ. العمليات الحسابية المتفرقة ليست سوى جزء واحد من الآلة.
تخلق حدود السعة حلاً وسطًا آخر. قد يؤدي إسقاط الرموز المميزة الزائدة أو تأخيرها أو إعادة توجيهها إلى حماية الإنتاجية، ولكن يجب أن يحافظ التنفيذ على جودة الإجابة في ظل حركة مرور حقيقية غير متساوية.
لماذا يمكن لوزارة التربية والتعليم أن تكون فعالة؟
توفر وزارة التربية قدرة تمثيلية أكبر دون تفعيل الشبكة بالكامل في كل مرة. للحصول على جودة الهدف، يمكن أن يقلل ذلك من التدريب أو حساب الاستدلال بالنسبة إلى نموذج كثيف قادر على نحو مماثل. ويمكنه أيضًا السماح لخبراء مختلفين بتعلم أنماط مفيدة من لغات أو مجالات متنوعة.
الكفاءة تعتمد على التنفيذ. يمكن للدفعات الكبيرة أن تبقي الخبراء مشغولين وتجعل التواصل جديرًا بالاهتمام. يمكن أن يؤدي التكميم إلى تقليل حركة مرور الذاكرة. يعمل التوجيه الجيد وطوبولوجيا الأجهزة على تقليل الازدحام. قد يفشل النموذج الذي يتم تقديمه عند الاستخدام المنخفض في تحقيق هذه المكاسب.
والأهم من ذلك، أن انخفاض الحوسبة لكل رمز لا يضمن انخفاض الطاقة لكل مهمة مكتملة. يمكن أن تفوق المخرجات الأطول وعمليات إعادة المحاولة ونوافذ السياق الكبيرة وأدوات الوكيل التوفير المعماري. كيفية تقليل البصمة الكربونية للذكاء الاصطناعي يركز على الوظيفة بأكملها بدلاً من خاصية نموذجية جذابة واحدة.
ولذلك فإن القياسات التشغيلية مفضلة على التقدير الورقي عند توفره. يجب مقارنة الطاقة وزمن الوصول والنجاح على نفس الأجهزة وظروف الدفعة والطلبات التمثيلية.
لماذا وزارة التربية ليست هي نفس النموذج الصغير
أ نموذج لغة صغير يحتوي على عدد أقل من المعلمات الإجمالية ويمكن أن يتناسب غالبًا مع الأجهزة المتواضعة. قد تحتوي وزارة التربية والتعليم على مجموعة كبيرة جدًا من الخبراء ولكنها لا تقوم إلا بتنشيط عدد قليل منهم. يمكن أن تبدو حساباتها الخاصة برمز واحد أصغر من حجمها الإجمالي، ومع ذلك يمكن أن يظل تخزينها ونشرها كبيرًا.
وهذا مهم بالنسبة للتقديرات البيئية. قد يؤدي الحساب الذي يعتمد فقط على إجمالي المعلمات إلى المبالغة في الحساب النشط. واحد يعتمد فقط على المعلمات النشطة قد يحذف الذاكرة والشبكات والسعة الخاملة والبنية التحتية الداعمة. لا يعد أي من الرقمين وحدهما مقياسًا لقوة المنشأة.
عند مقارنة النماذج، اسأل عن إجمالي المعلمات، والمعلمات النشطة لكل رمز، والدقة الرقمية، والسياق النموذجي وطول الإخراج، والأجهزة المستخدمة. ثم اختبر الجودة والطاقة لنفس المهمة الكاملة.
بالنسبة للنشر المحلي، قد تكون الذاكرة الإجمالية هي قيد الربط حتى عندما تبدو الحسابات النشطة قابلة للإدارة. يمكن أن يكون النموذج المدمج الكثيف هو الخيار الأكثر عملية على الأجهزة المحدودة.
ما الذي تغيره وزارة التربية والتعليم للمستخدمين
لا يستطيع المستخدمون عادةً التحكم في التوجيه داخل النموذج المستضاف. يمكنهم التحكم في الطلب من حوله: توفير السياق ذي الصلة، وطلب المخرجات المتناسبة وتجنب عمليات التجديد غير الضرورية. يتحكم موفرو النماذج في تعيين الخبراء، والتجميع، والقدرة، وكفاءة الأجهزة.
قد يكون نموذج وزارة التربية خيارًا جيدًا لخدمة واسعة لأنه يجمع بين القدرة والتنشيط المتناثر. ربما لا يزال الأمر مفرطًا بالنسبة للاستخراج البسيط الذي يمكن لنموذج كثيف مضغوط التعامل معه. الذكاء الاصطناعي الأخضر يعني الاختيار بين البنى المعمارية بناءً على القيمة المقدمة والموارد المقاسة، وليس افتراض أن المتناثر يفوز دائمًا.
Treechat يقوم إيصال بتقدير الطاقة التشغيلية باستخدام النموذج المحدد وعدد الرموز المميزة، ثم يضيف النفقات العامة المحددة لمركز البيانات. ونظرًا لأن مقدمي الخدمات لا يكشفون عن توجيه الخبراء المباشر أو قوة كل استجابة، فإنه يظل تقريبيًا قائمًا على النموذج. يتم نشر الافتراضات والاستثناءات في /methodology.
الملخص البسيط هو أن مزيج الخبراء يفصل مقدار ما يعرفه النموذج عن مقدار ما يعمل منه في وقت واحد. وهذا يمكن أن يجعل السعة الكبيرة أكثر كفاءة من الناحية الحسابية، لكن الذاكرة والاتصالات وسلوك عبء العمل الحقيقي تحدد ما إذا كان الوعد سيصبح توفيرًا فعليًا.