Treechat
القائمة
جرّبه مجانًا
كل الملاحظات

هل تستخدم نماذج الذكاء الاصطناعي الصغيرة طاقة أقل؟

عادة، نعم، ولكن عدد المعلمات ليس مقياسًا للطاقة. الهندسة المعمارية، والأجهزة، والرموز المميزة، والتجميع، وما إذا كان النموذج يكمل المهمة، كلها أمور مهمة.

بقلم Treechat5 دقيقة قراءة
يكمل المعالج المدمج ومجموعة الخوادم الأكبر حجمًا نفس المهمة المتواضعة.

عادةً ما تستخدم نماذج الذكاء الاصطناعي الصغيرة طاقة أقل لكل رمز مميز مقارنة بالنماذج الكبيرة في ظل ظروف مماثلة. يقومون عمومًا بإجراء عمليات حسابية أقل وينقلون بيانات معلمات أقل عبر الذاكرة. وهذا يجعل حجم النموذج أحد أكثر الروافع العملية لتقليل طاقة الذكاء الاصطناعي اليومي.

لكن كلمة "صغير" ليست قياسًا كاملاً. في بعض الأحيان، يمكن للنموذج الأكبر المُحسّن جيدًا على الأجهزة الحديثة أن يخدم المهمة بكفاءة، في حين أن النموذج الصغير الذي يعمل بشكل سيئ أو يكرر المحاولات الفاشلة قد يؤدي إلى إهدار الطاقة. تؤثر الهندسة المعمارية والدقة العددية وطول المدخلات والمخرجات والتجميع والحمل العام لمركز البيانات على النتيجة. وبالتالي فإن المطالبة الصحيحة هي: اختيار أصغر نموذج يمكنه إكمال المهمة بشكل موثوق، ثم قياس أو تقدير المهمة بأكملها.

لماذا يساعد عدد أقل من المعلمات عادةً

المعلمات هي القيم الرقمية المستفادة التي يستخدمها النموذج لتحويل المدخلات والتنبؤ بالمخرجات. بالنسبة لنموذج لغة كثيفة، يتضمن كل رمز مميز يتم إنشاؤه عمليات عبر جزء كبير من النموذج وحركة الأوزان من الذاكرة. عادةً ما يؤدي تقليل عدد المعلمات إلى تقليل كلا النوعين من العمل.

يمكن أيضًا أن تتناسب النماذج الأصغر حجمًا مع عدد أقل من المسرعات بسهولة أكبر. يمكن أن يؤدي ذلك إلى تقليل الاتصال بين الرقائق وجعل الخدمة أكثر بساطة. عندما تتعامل الخدمة مع العديد من المستخدمين معًا، يمكن أن يؤدي التجميع إلى توزيع الحمل الثابت على عدة استجابات.

هذه أسباب مادية، وليست ضمانًا مرفقًا بملصق المنتج. لا يزال مقدم الخدمة بحاجة إلى الكشف عن النموذج والأجهزة والاستخدام ذي الصلة أو تقديره إذا كان يريد قياس التوفير.

عدد المعلمات لا يحكي القصة بأكملها

يمكن ضغط النموذج من خلال دقة عددية أقل، وهو ما يسمى غالبًا بالتكميم. يمكن تقليمها أو استخلاصها من معلم أكبر أو تدريبها على استخدام الحساب بشكل أكثر انتقائية. تحدد نواة البرامج وتصميم المسرع أيضًا مدى كفاءة العمليات النظرية في أن تصبح إجابات فعلية.

نماذج مزيج الخبراء تجعل حجم العنوان أمرًا صعبًا بشكل خاص. قد تحتوي على العديد من المعلمات الإجمالية ولكنها تقوم فقط بتنشيط مجموعة فرعية لكل رمز مميز. يمكن أن يشبه الحساب النشط نموذجًا أصغر على الرغم من أن النموذج المخزن كبير. لا يزال التوجيه والذاكرة والاتصالات يستهلك الموارد، لذا فإن "المعلمات النشطة" تعد مفيدة ولكنها ليست رقمًا كاملاً للطاقة.

يمكن أن يطغى طول الإخراج على مقارنة الحجم البسيطة أيضًا. قد يقوم النموذج الصغير الذي ينتج 4,000 رمزًا بعمل إجمالي أكبر من النموذج الأكبر الذي يعطي إجابة صحيحة مكونة من 200 رمز.

تدعم الأدلة مطابقة النماذج للمهام

قام لوتشيوني وجيرنيت وستروبيل بمقارنة استخدام الطاقة عبر مجموعة من مهام التعلم الآلي في المعالجة الجائعة للطاقة. في ظروفها التي تم تقييمها، كانت النماذج التوليدية للأغراض العامة أكثر استهلاكًا للطاقة من الأنظمة الخاصة بمهمة محددة للعديد من المهام. تعد النقطة الأوسع في الورقة أكثر فائدة من حفظ رقم مرجعي واحد: اختيار النموذج والمهمة يغير طاقة الاستدلال بشكل مادي.

لا يحدد هذا الدليل نسبة واحدة لكل روبوت محادثة حالي. تتغير الأجهزة والنماذج، وتختلف المطالبات المعيارية عن حركة المرور المباشرة، ولا يمكن للمصنف المتخصص أن يحل محل المساعد العام للعمل المفتوح. إنه يدعم تجنب النموذج التوليدي الكبير عندما تحل المشكلة بأداة ضيقة وفعالة.

وينطبق المبدأ نفسه داخل الدردشة: إعادة الكتابة والتفسيرات الروتينية قد لا تحتاج إلى النموذج المخصص للاستدلال المعقد.

القدرة وإعادة المحاولة تنتمي إلى الحساب

الطاقة لكل محاولة ليست دائمًا طاقة لكل مهمة مكتملة. إذا أساء النموذج فهم التعليمات أو اخترع التفاصيل أو لم يتمكن من إدارة السياق، فقد يقوم المستخدمون بإعادة إنشاء النماذج وإعادة صياغتها وتبديلها في النهاية. يتم احتساب تلك المحاولات.

وعلى العكس من ذلك، فإن إرسال كل طلب افتراضيًا إلى النظام المتاح الأكثر قدرة ينفق حسابات إضافية على الوظائف التي لا تستفيد منه. يمكن لجهاز التوجيه الجيد تقديم الطلبات الشائعة على نموذج أصغر وتصعيدها فقط عندما يتطلب تعقيد المهمة ذلك. يجب أن يكون المستخدم أيضًا قادرًا على اختيار الخيار الأكبر عندما تكون الدقة أو القدرة مهمة.

هذا هو الرابط العملي بين حجم النموذج و لماذا يستخدم الذكاء الاصطناعي الكثير من الطاقة؟: العبء الحسابي يعتمد على كل من الآلة والمهمة المطلوبة منها.

يتطلب تدريب نموذج أصغر عمومًا عمليات حسابية أقل من تدريب نموذج أكبر مماثل من الصفر، وكل الأمور الأخرى متساوية. في الممارسة العملية، قد يشمل التطوير عمليات البحث في الهندسة المعمارية، وعمليات التشغيل الفاشلة، والضبط الدقيق، والتقطير من نموذج آخر. نادراً ما توفر الإفصاحات العامة إجمالي دورة الحياة الكاملة.

بعد الإصدار، ينمو الاستدلال مع الاستخدام. قد يستهلك النموذج الصغير المشهور جدًا قدرًا أكبر من الكهرباء التشغيلية بشكل إجمالي مقارنة بالنموذج الكبير الذي نادرًا ما يستخدم. وهذا لا يجعل النموذج الصغير غير فعال لكل إجابة؛ إنه يوضح لماذا تجيب الكفاءة لكل مهمة والطلب على مستوى النظام على أسئلة مختلفة.

دليلنا ل تدريب الذكاء الاصطناعي مقابل انبعاثات الاستدلال يشرح لماذا لا يمكن لنسبة ثابتة أن تقسم الاثنين دون معرفة مدى استخدام النموذج.

ما هي النماذج الصغيرة جيدة ل

غالبًا ما تكون النماذج الصغيرة مناسبة لإعادة الكتابة وتلخيص النص المعتدل والتصنيف والاستخراج والتفسيرات المباشرة والعصف الذهني وأنماط الترميز الشائعة. كما أن تشغيلها محليًا يمكن أن يساعد أيضًا في الحفاظ على الخصوصية، على الرغم من أن كفاءة استخدام الكهرباء للكمبيوتر المحمول مقابل خادم جيد الاستخدام يعتمد على الأجهزة وعبء العمل.

قد تكسب النماذج الأكبر تكلفتها بسبب التفكير الصعب متعدد الخطوات، أو التعليمات البرمجية المتخصصة، أو السياق الطويل جدًا، أو المهام التي تؤدي فيها الإجابة الأولى الأضعف إلى إعادة صياغة بشرية باهظة الثمن. الخيار البيئي هو عدم قبول الجودة الرديئة. والهدف من ذلك هو تجنب دفع قسط الحوسبة للنموذج الحدودي حيث لا تغير القدرة النتيجة.

ال تكلفة الطاقة لرسالة واحدة من الذكاء الاصطناعي لذلك يحتاج إلى نموذج وعدد رمزي، وليس فقط كلمة "AI".

كيفية إجراء مقارنة عادلة

مقارنة النماذج في نفس المهمة وعتبة الجودة وطول الإخراج. تضمين المحاولات الفاشلة. اذكر ما إذا كانت الأرقام تغطي طاقة الرقائق أو إجمالي طاقة المنشأة، وما إذا كان استخدام الأجهزة قابلاً للمقارنة. تجنب تحويل نسب المعلمات مباشرة إلى نسب طاقة بدون دليل.

Treechat يستخدم نموذجًا أصغر للأسئلة اليومية بشكل افتراضي ويتيح للمستخدم اختيار خيار أكبر عندما تحتاج المهمة إليه. ويقدر إيصالها الطاقة التشغيلية من استخدام النموذج والرمز المميز، مع السماح المفصح عنه للنفقات العامة لمركز البيانات. إنها مقارنة نموذجية، وليست قراءة مباشرة للعداد؛ يتم نشر الطريقة الحالية في /methodology.

لذا، نعم: تستخدم النماذج الصغيرة عادةً طاقة أقل للاستدلال المقارن. وتظهر ميزتهم الحقيقية عندما يتم خدمتهم بشكل جيد، وينتجون إجابة مفيدة دون إعادة المحاولة، ويستبدلون نموذج العمل الأكبر حجمًا - وليس عندما يتم التعامل مع كلمة "صغير" على أنها علامة استدامة سحرية.

هل تستخدم نماذج الذكاء الاصطناعي الصغيرة طاقة أقل؟ · Treechat blog