ما هي نماذج اللغة الصغيرة؟
تستخدم نماذج اللغات الصغيرة معلمات أقل وحوسبة أقل من النماذج الكبيرة، مما يجعلها عملية للمهام المركزة والاستخدام المحلي وخدمات الذكاء الاصطناعي الفعالة.

نماذج اللغة الصغيرة، أو SLMs، هي نماذج لغوية مصممة بمعلمات أقل ومتطلبات حسابية أقل من النماذج الكبيرة المستخدمة على الحدود. يمكنهم تلخيص المعلومات واستخراجها وإعادة كتابة النص وتصنيف المحتوى والإجابة على الأسئلة المركزة، وغالبًا ما يكون ذلك بزمن وصول أقل واستخدام للذاكرة والطاقة لكل رمز مميز.
لا توجد عتبة معلمة رسمية يصبح عندها النموذج "صغيرًا". المصطلح يتعلق بالأجهزة والفترة والمقارنة. من الواضح أن النموذج الذي يناسب الهاتف صغير الحجم بجانب نموذج مركز البيانات، ولكن قد يقوم مزودان بتطبيق التسمية بشكل مختلف. الأسئلة المفيدة هي مقدار النموذج النشط، وما هي الأجهزة التي يحتاجها، وما إذا كان يكمل مهمتك بشكل موثوق.
يمكن أن يكون النموذج اللغوي مفيدًا دون أن يكون هائلاً
تتعلم نماذج اللغة الأنماط العددية من النص وتستخدمها للتنبؤ بالرموز المميزة. يمكن للنماذج الأكبر حجمًا أن تحتوي على المزيد من المعلمات وغالبًا ما تؤدي أداءً جيدًا عبر نطاق أوسع من المهام غير المألوفة. كما أنها تتطلب المزيد من الذاكرة والحساب للتدريب والخدمة.
النماذج الصغيرة تتاجر ببعض الاتساع مقابل الكفاءة. يمكن لبيانات التدريب الدقيقة والتقطير والضبط الدقيق المركز أن تحافظ على الأداء القوي في المهام الشائعة أو الضيقة. مايكروسوفت التقرير الفني لفاي-3، على سبيل المثال، يصف نموذجًا يحتوي على 3.8 مليار معلمة مصممًا ليكون قادرًا بما يكفي للنشر على الهاتف. تنتمي نتائجها المعيارية إلى هذا النموذج ومجموعة الاختبار؛ فهي لا تثبت أن كل نموذج صغير ينافس نموذجًا أكبر.
لذلك فإن كلمة "صغير" تصف فئة الموارد، وليس ضمان الجودة. يمكن أن يكون النموذج المدمج ممتازًا في الاستخراج وضعيفًا في التفكير الصعب، تمامًا كما قد يكون النموذج الكبير غير ضروري للتنسيق الروتيني.
وينبغي ذكر تاريخ المقارنة أيضا. ما كان يعتبر مدمجًا منذ عدة سنوات قد يبدو عاديًا الآن مع تحسن تصميم الأجهزة والنماذج.
لماذا تحتاج النماذج الصغيرة عادةً إلى طاقة أقل؟
في المحولات الكثيفة التقليدية، يتطلب إنشاء رمز مميز إجراء حسابات عبر معظم أوزان النموذج. تعني المعلمات الأقل عمومًا عددًا أقل من القيم التي يتم نقلها عبر الذاكرة وعمليات أقل يتم تنفيذها. قد يعمل الطراز المدمج أيضًا على أجهزة أصغر ويخدم المزيد من الطلبات ضمن ميزانية ذاكرة معينة.
ولهذا السبب يعد حجم النموذج عاملاً بيئيًا مفيدًا. إنه ليس عداد الطاقة. الدقة العددية، وطول التسلسل، والتجميع، وتوليد المسرعات وتحسين البرامج، كلها تغير الطاقة لكل نتيجة. يمكن للنموذج الصغير الذي يتم استخدامه بشكل سيئ أن يهدر القدرة، في حين أن النموذج الأكبر الذي ينجح مرة واحدة قد يتغلب على النداءات الفاشلة المتكررة لنموذج أضعف.
مقالتنا على كيفية تقليل البصمة الكربونية للذكاء الاصطناعي يستخدم القاعدة العملية: اختر أصغر نموذج يكمل المهمة بأكملها بشكل موثوق. قم بإحصاء عدد مرات إعادة المحاولة والتصحيحات بدلاً من مقارنة رمز مميز واحد معزول.
يمكن أن يؤدي طول الإدخال إلى تضييق الميزة. لا تزال معالجة مستند ضخم على نموذج مضغوط عملاً كبيرًا، لذا يظل ضبط السياق مفيدًا في كل حجم نموذج.
كيف تصنع النماذج الصغيرة قادرة؟
يقوم منشئو النماذج بأكثر من مجرد إزالة الطبقات. إنهم ينظمون بيانات التدريب بحيث يتم إنفاق سعة محدودة على أنماط مفيدة، ويقومون بتدريس نماذج أصغر من مخرجات أو تمثيلات المعلمين الأكبر حجمًا، ثم يقومون بضبطها لتناسب مجالات معينة. يقوم التكميم بتخزين الأوزان وحسابها بدقة أقل، مما يقلل الذاكرة وغالبًا ما يؤدي إلى تسريع الاستدلال.
يزيل التقليم الأوزان أو الهياكل التي يُعتقد أنها لا تساهم إلا قليلاً. يمكن أن يوفر الاسترجاع المستندات ذات الصلة في وقت الطلب بدلاً من مطالبة النموذج بحفظ كل حقيقة. يعمل التصميم الجيد للتطبيق على تضييق المشكلة من خلال المدخلات والأدوات والتحقق المنظم.
كل تقنية لها مقايضات. يمكن للتقطير إعادة إنتاج قيود المعلم. الكمي العدواني قد يقلل من الجودة. يمكن أن يؤدي الضبط الدقيق إلى إضعاف السلوك العام. يجب اختبار المطالبات على المهمة الفعلية ومتطلبات اللغة والسلامة، وليس الاستدلال عليها من عدد المعلمات وحده.
تحتاج بيانات التقييم إلى رعاية مماثلة. يمكن أن يبدو النموذج قادرًا لأن المواد التدريبية الخاصة به تتداخل مع المعيار، بينما يفشل في الحصول على أمثلة جديدة من التطبيق الذي من المفترض أن يخدمه.
حيث تعمل نماذج اللغة الصغيرة بشكل جيد
العمل المركّز والمتكرر هو المجال الطبيعي. تشمل الأمثلة تصنيف تذاكر الدعم، واستخراج الحقول من أنواع المستندات المعروفة، واقتراح ردود قصيرة، وإعادة كتابة النص إلى نمط المنزل، والإجابة على الأسئلة من قاعدة معرفية خاضعة للرقابة. يمكن أن يؤدي انخفاض زمن الاستجابة والتكلفة إلى جعل النشر المحلي أو النشر على الحافة أمرًا عمليًا.
يمكن أن يؤدي التشغيل محليًا إلى تحسين الخصوصية لأن البيانات لا تحتاج إلى مغادرة الجهاز، على الرغم من أن سلوك الشبكة الفعلي للتطبيق لا يزال مهمًا. ويمكنه أيضًا تجنب الوصول المستمر إلى الشبكة. لا يؤدي الاستدلال المحلي إلى تقليل الكربون تلقائيًا: فالكمبيوتر المحمول القديم الذي يقوم بعمل بطيء قد يستهلك طاقة أكبر من الخادم المشترك الفعال، وتظل البصمة المتجسدة للجهاز باقية.
تعتبر النماذج الصغيرة أقل موثوقية بالنسبة للاستدلال المعقد متعدد الخطوات والمعرفة الغامضة والمستندات الطويلة والتعليمات البرمجية الصعبة. يكون التصعيد معقولًا عندما يُظهر الاختبار أن المهمة تتجاوز قدراتهم. إن التصميم المستدام لا يشكل حظراً على النماذج الكبيرة؛ إنه توجيه متعمد.
يمكن جعل الحدود مرئية للمستخدمين. قد تشرح الخدمة أن العمل الروتيني يستخدم نموذجها السريع وتقدم ترقية مقصودة للحالات التي يكون فيها التفكير المنطقي يستحق التأخير والموارد.
الصغيرة والمتفرقة والمتخصصة ليست مرادفات
يحتوي نموذج اللغة الصغيرة على بصمة إجمالية متواضعة نسبيًا في المعلمات والذاكرة. يتم تدريب النموذج المتخصص أو ضبطه ليناسب نطاقًا ضيقًا مهما كان حجمه. يحتوي النموذج المتناثر على العديد من المعلمات ولكنه ينشط بعضها فقط لمدخل معين.
وتشمل هذه الفئة الأخيرة نماذج خليط من الخبراء. يمكن أن يكون لديهم إجمالي عدد كبير من المعلمات أثناء استخدام مجموعة فرعية نشطة أصغر لكل رمز مميز. قد تشبه الحوسبة نموذجًا أصغر كثافة، لكن لا يزال يتعين تخزين جميع الخبراء وتوزيعهم، حتى لا تختفي الذاكرة والاتصالات.
عندما يقوم مقدم الخدمة بالترويج لنموذج "صغير" أو "فعال"، اطلب المعلمات الإجمالية والنشطة، ومتطلبات الأجهزة، والرموز المميزة في الثانية، وحدود الطاقة، وجودة المهمة. لا توجد تسمية واحدة تجيب على كل هذه الأسئلة.
قم أيضًا بتمييز ملف النموذج القابل للتنزيل عن الذاكرة المطلوبة أثناء تشغيله. يمكن لسياق العمل وذاكرات التخزين المؤقت وعمليات التطبيق أن تجعل النشر أكبر مما توحي به الأوزان وحدها.
كيفية اختيار واحد بمسؤولية
قم ببناء مجموعة تقييم تمثيلية، بما في ذلك الأمثلة الصعبة والحساسة للسلامة. اختبر أصغر مرشح، وسجل النجاح والكمون والطاقة المقدرة أو المقاسة، ثم قارن النموذج التالي باستخدام نفس الشروط. تضمين الاسترجاع واستدعاءات الأدوات وإعادة المحاولة والتصحيح البشري.
بالنسبة للمؤسسات، قم بمراقبة التوزيع بعد الإطلاق. يمكن لجهاز التوجيه الذي يرسل معظم حركة المرور الروتينية إلى نموذج صغير والاستثناءات الحقيقية لنموذج أكبر أن يحافظ على الجودة دون تقصير كل طلب إلى الحد الأقصى من الحوسبة. دليل عملي للذكاء الاصطناعي المستدام يغطي القياس والحوكمة حول هذا النمط.
Treechat يستخدم نماذج أصغر للأسئلة اليومية ويوفر قدرة أكبر عند الحاجة. يقوم إيصال كل إجابة بتقدير الطاقة التشغيلية من استخدام النموذج والرمز المميز، ويضيف النفقات العامة لمركز البيانات المنشور ويطبق عامل الشبكة المحدد. إنه ليس قياسًا مباشرًا للأجهزة. العوامل والقيود الحالية في /methodology.
نماذج اللغة الصغيرة مهمة لأن الكثير من العمل اللغوي اليومي لا يتطلب أكبر نظام متاح. وباستخدامها ضمن حدودها، يمكنها جعل الذكاء الاصطناعي أسرع وأرخص وأقل استهلاكًا للطاقة. عند استخدامها كتسمية تسويقية دون اختبار المهام أو قياسها، فإن كلمة "صغير" لا تعني سوى القليل جدًا.