Treechat
القائمة
جرّبه مجانًا
كل الملاحظات

تدريب الذكاء الاصطناعي مقابل انبعاثات الاستدلال

التدريب يخلق النموذج في دفعة مركزة. الاستدلال يخدم ذلك مرارا وتكرارا. أيهما ينبعث أكثر يعتمد بشكل أساسي على الاستخدام مدى الحياة والكهرباء.

بقلم Treechat5 دقيقة قراءة
تفسح مجموعة كبيرة من نماذج التدريب الطريق للعديد من محطات عمل الاستدلال الأصغر حجمًا.

تأتي انبعاثات تدريب الذكاء الاصطناعي من الحوسبة المركزة المستخدمة لإنشاء نموذج أو تحديثه بشكل كبير. تأتي انبعاثات الاستدلال من تشغيل هذا النموذج في كل مرة يطلب فيها شخص ما إجابة أو تنبؤًا أو صورة. يمكن أن يكون التدريب مهمة كبيرة جدًا لمرة واحدة؛ يكون الاستدلال أصغر لكل مهمة ولكنه يتكرر طوال عمر نشر النموذج.

ولا تكون الحصة الأكبر دائمًا. يمكن للنموذج الشائع الذي يخدم حركة مرور هائلة أن يتراكم انبعاثات استدلالية أكثر من التدريب. فالنموذج المكلف الذي نادرا ما يستخدم قد يظل تحت سيطرة التدريب. وتعتمد النتيجة أيضًا على كفاءة الأجهزة، وطول المهمة، والنفقات العامة لمركز البيانات، وكثافة الكربون في الكهرباء. وينبغي التعامل مع أي ادعاء عالمي مثل "التدريب هو 90% من انبعاثات الذكاء الاصطناعي" بحذر ما لم يتم إرفاق نموذجه وفترته الزمنية وحدوده المحاسبية.

ماذا يحدث أثناء التدريب

يقوم التدريب بتغذية البيانات من خلال النموذج، ومقارنة مخرجاته بهدف التعلم وتحديث المعلمات. تتكرر هذه الدورة عبر العديد من الدفعات في مجموعات من المسرعات. تستخدم عمليات التشغيل الكبيرة أيضًا شبكات وتخزين وتبريد عالية السرعة.

لا تمثل عملية التدريب النهائية بالضرورة بصمة التطوير الكاملة. تقوم الفرق باختبار البنيات وضبط الإعدادات وإعداد البيانات وفي بعض الأحيان التخلي عن عمليات التشغيل. يضيف الضبط الدقيق وتحديثات النموذج الأحدث مزيدًا من العمليات الحسابية. قد تتضمن التقارير العامة فقط التشغيل الناجح أو برنامج بحث أوسع أو لا شيء خاص بنموذج محدد على الإطلاق.

ثم يعتمد الكربون على مكان وزمان حدوث هذا العمل. ولا يمكن تحويل عملية التدريب المقاسة بالميجاواط/ساعة إلى انبعاثات دون افتراض إمدادات الكهرباء.

ماذا يحدث أثناء الاستدلال

يستخدم الاستدلال المعلمات المدربة دون تحديثها. بالنسبة لنموذج اللغة، تقوم الخدمة بمعالجة الموجه وتتنبأ برموز الإخراج واحدًا تلو الآخر. يتطلب السياق والمخرجات الأطول عمومًا المزيد من العمل. يمكن لميزات الاستدلال والبحث والوكيل تشغيل الرموز المخفية أو عدة مكالمات.

الخدمة لها أيضًا تعقيدات تشغيلية. قد تنتظر الأجهزة حركة المرور، وقد يتم تجميع الطلبات، وقد يتم تقسيم النماذج عبر المسرعات. يمكن للخادم المُستخدم بكثرة أن ينشر الحمل الثابت عبر استجابات أكثر من الخادم المستخدم قليلاً. يضيف التبريد والشبكات وتحويل الطاقة الطلب على المرافق.

لوتشيوني، جيرنيت وستروبلز مقارنة الاستدلال وجد تباينًا كبيرًا بين المهام وأنواع النماذج، مما يعزز أن "الاستدلال الواحد" ليس وحدة طاقة قياسية.

الاستخدام مدى الحياة يقرر التوازن

تخيل أن التدريب بمثابة توازن مسبق والاستدلال كمقياس يرتفع مع كل استخدام. تعتمد النقطة التي يتفوق فيها الاستدلال على التدريب على بصمة التدريب الأولية مقسومة على الطاقة التشغيلية لكل طلب. كلا الرقمين غير مؤكدين، ولا يمكن معرفة حجم الطلب مدى الحياة عند الإطلاق.

وهذا يجعل تخصيص التدريب لكل رسالة هشًا. قسّم على حركة المرور المتوقعة طوال العمر وتغييرات البصمة المخصصة عندما يختلف الاعتماد عن التنبؤ أو يتقاعد النموذج مبكرًا. يمكن أن يكون مفيدًا لتحليل السيناريو، ولكن لا ينبغي وصفه بأنه كهرباء مستهلكة عندما يضغط مستخدم معين على إرسال.

دليلنا ل كمية ثاني أكسيد الكربون التي ينتجها الذكاء الاصطناعي يبقي عرض دورة الحياة المخصص هذا منفصلاً عن تقدير الاستجابة التشغيلية.

يقوم التقطير بتدريب نموذج أصغر على إعادة إنتاج السلوك المفيد من نموذج أكبر. وهذا يضيف حساب التطوير ولكنه قد يقلل من الطاقة عبر العديد من الاستدلالات المستقبلية. يمكن أن يتطلب التكميم أو التقليم أيضًا التحضير مع خفض تكاليف التقديم. ما إذا كانت التجارة تؤتي ثمارها يعتمد على الحجم.

على العكس من ذلك، فإن تدريب نموذج عام ذو قدرة عالية قد يؤدي إلى تجنب تدريب العديد من النماذج المحدودة، ولكن خدمته في مهام بسيطة يمكن أن يكون إهدارًا. يمكن أن يؤدي توجيه الطلبات الشائعة إلى نموذج أصغر وحجز النظام الكبير للعمل الصعب إلى تقليل الطلب المستمر.

هل تستخدم نماذج الذكاء الاصطناعي الصغيرة طاقة أقل؟ يفحص سبب كون الإجابة بشكل عام نعم لكل مهمة قابلة للمقارنة، في حين أن القدرة وإعادة المحاولة لا تزال تنتمي إلى الإجمالي.

إن حساب الكربون يغير كلا الجانبين

يمكن أن يكون لجولتين تدريبيتين متساويتين في الطاقة انبعاثات مختلفة على شبكات مختلفة. يمكن توزيع الاستدلال جغرافيًا، لذلك قد تختلف كثافة الكربون باختلاف المناطق والساعات. قد تغير عقود الطاقة المتجددة تقارير الشركات القائمة على السوق دون تغيير مزيج الشبكة المادية في كل لحظة.

الانبعاثات المجسدة تزيد من تعقيد الانقسام. هل ينبغي إسناد عملية تصنيع مجموعة التدريب إلى التدريب، حتى لو كانت الأجهزة تخدم الاستدلال لاحقًا؟ كيف ينبغي تخصيص مبنى مركز بيانات مشترك عبر الذكاء الاصطناعي وأعباء العمل التقليدية؟ لا توجد إجابة خالية من السياق.

ال البصمة الكربونية للذكاء الاصطناعي ولذلك فهو أوسع من التدريب بالإضافة إلى الاستدلال بالكهرباء. يجب أن تظهر الرقائق والمباني وسلاسل التوريد في مكان ما في تقييم دورة الحياة الكاملة.

لماذا نادراً ما تفصل توقعات النظام بينهما بشكل نظيف

يرى مخططو الشبكة الطلب على المرافق. قد يقوم مركز البيانات بتدريب نموذج واحد أثناء خدمة العديد من النماذج الأخرى وتشغيل أحمال العمل السحابية غير المرتبطة بالذكاء الاصطناعي. لا تكشف إعلانات السعة العامة دائمًا عن الاستخدام أو مزيج عبء العمل.

وتقدر وكالة الطاقة الدولية أن مراكز البيانات العالمية تستخدم حوالي 415 تيراواط ساعة في عام 2024 وتتوقع حوالي 945 تيراواط ساعة في عام 2030 في حالتها الأساسية. وهي تحدد الخوادم المتسارعة، المدفوعة بشكل أساسي بالذكاء الاصطناعي، كمصدر رئيسي للنمو. تحتوي هذه الأرقام على التدريب والاستدلال والخدمات غير المتعلقة بالذكاء الاصطناعي بدلاً من الانقسام النظيف.

هذا العرض المشترك مناسب لتخطيط الكهرباء. لا يمكنها إخبار المستخدم عن مقدار الإجابة التي تنتمي إلى فترة تدريب سابقة.

ما هي الانبعاثات التي يجب التركيز عليها؟

يجب على مطوري النماذج الكشف عن طاقة التدريب والموقع والأجهزة ونطاق التطوير؛ تحسين كفاءة التدريب. وتجنب عمليات التشغيل المكررة غير الضرورية. يجب على مشغلي الخدمة تتبع الاستدلال واستخدام النماذج ذات الحجم المناسب وزيادة الاستخدام وتقليل الرموز غير الضرورية والحصول على كهرباء منخفضة الكربون. تحتاج انبعاثات الأجهزة والبناء إلى خطط التخفيض الخاصة بها.

يتمتع المستخدمون بتأثير أكبر على الاستدلال: اختيار نموذج مناسب، والحد من المخرجات غير الضرورية، وتجنب الأجيال المتكررة. لا يمكنهم تغيير عملية التدريب بأثر رجعي، لكن الطلب يمكن أن يؤثر على موفري الأنظمة الذين ينشرونها.

Treechat يقوم إيصال كل إجابة بتقدير الاستدلال التشغيلي بدلاً من تخصيص التدريب التاريخي أو الانبعاثات المضمنة. ويستخدم أعداد النماذج والرموز المميزة مع افتراضات مركز البيانات والشبكة المنشورة. هذه الحدود الأضيق واضحة بالنسبة لنا صفحة المنهجية.

التدريب مقابل الاستدلال ليس مسابقة مع فائز واحد دائم. قم بالإبلاغ عن المرحلة الأولية المركزة والمرحلة التشغيلية المتراكمة ودورة الحياة الأوسع بشكل منفصل. ومن ثم يمكن للقرارات أن تستهدف الانبعاثات التي يمكنها تغييرها بالفعل.