Antrenamentul AI vs emisii de inferență
Antrenamentul creează modelul într-o explozie concentrată; inferența îi servește în mod repetat. Care emite mai mult depinde în principal de utilizarea pe durata vieții și de electricitate.

Emisiile de antrenament AI provin din calculul concentrat folosit pentru a crea sau actualiza substanțial un model. Emisiile de inferență provin din operarea acelui model de fiecare dată când cineva solicită un răspuns, o predicție sau o imagine. Formarea poate fi un loc de muncă foarte mare; Inferența este mai mică pentru fiecare sarcină, dar se repetă pe toată durata de viață a modelului.
Nici ponderea mai mare nu este întotdeauna. Un model popular care deservește un trafic enorm poate acumula mai multe emisii de inferență decât antrenament. Un model costisitor care este abia folosit poate rămâne dominat de antrenament. Rezultatul depinde, de asemenea, de eficiența hardware-ului, durata sarcinii, supraîncărcarea centrului de date și intensitatea de carbon a electricității. Orice afirmație universală precum „antrenamentul reprezintă 90% din emisiile de IA” ar trebui tratată cu prudență, cu excepția cazului în care modelul, perioada de timp și limita contabilă sunt atașate.
Ce se întâmplă în timpul antrenamentului
Antrenamentul furnizează date printr-un model, compară rezultatele acestuia cu un obiectiv de învățare și actualizează parametrii. Acest ciclu se repetă în multe loturi pe grupuri de acceleratoare. Rulele mari folosesc, de asemenea, rețele de mare viteză, stocare și răcire.
Cursa finală de antrenament nu este neapărat amprenta completă a dezvoltării. Echipele testează arhitecturile, ajustează setările, pregătesc date și uneori abandonează rulările. Reglarea fină și actualizările ulterioare ale modelului adaugă mai multe calcule. Raportarea publică poate include doar succesul, un program de cercetare mai larg sau nimic specific modelului.
Carbonul depinde apoi de unde și când are loc această activitate. O cursă de antrenament măsurată în megawați-oră nu poate fi convertită în emisii fără o ipoteză privind furnizarea de energie electrică.
Ce se întâmplă în timpul inferenței
Inferența utilizează parametrii antrenați fără a-i actualiza. Pentru un model de limbă, serviciul procesează promptul și prezice jetoanele de ieșire unul câte unul. Contextul și rezultatele mai lungi necesită, în general, mai multă muncă. Funcțiile de raționament, căutare și agent pot declanșa jetoane ascunse sau mai multe apeluri.
Servirea are și complicații operaționale. Hardware-ul poate aștepta trafic, solicitările pot fi grupate, iar modelele pot fi împărțite pe acceleratoare. Un server intens utilizat poate răspândi supraîncărcarea fixă pe mai multe răspunsuri decât unul ușor utilizat. Răcirea, conectarea în rețea și conversia energiei adaugă cererea pentru instalații.
Luccioni, Jernite și Strubell’s comparație prin inferență au găsit variații substanțiale între sarcini și tipuri de model, întărind faptul că „o singură inferență” nu este o unitate energetică standard.
Utilizarea pe viață decide echilibrul
Imaginați-vă antrenamentul ca un echilibru inițial și inferență ca un metru care crește cu fiecare utilizare. Punctul în care inferența depășește antrenamentul depinde de amprenta antrenamentului inițial împărțită la energia operațională per cerere. Ambele numere sunt incerte, iar volumul cererilor pe durata de viață este de necunoscut la lansare.
Acest lucru face ca alocarea antrenamentului pe mesaj să fie fragilă. Împărțiți la traficul pe durata de viață estimată și amprenta alocată se modifică atunci când adoptarea diferă de prognoză sau modelul se retrage mai devreme. Poate fi util pentru analiza scenariului, dar nu ar trebui descris ca energie electrică consumată atunci când un anumit utilizator a apăsat pe trimitere.
Ghidul nostru pentru cât CO2 produce IA păstrează această vizualizare a ciclului de viață alocat separat de o estimare a răspunsului operațional.
Distilarea antrenează un model mai mic pentru a reproduce comportamentul util de la unul mai mare. Acest lucru adaugă calcul de dezvoltare, dar poate reduce energia în multe inferențe viitoare. Cuantificarea sau tăierea poate necesita, de asemenea, pregătire, reducând în același timp costurile de servire. Dacă tranzacția se returnează depinde de amploare.
În schimb, antrenarea unui model general de înaltă capacitate poate evita antrenarea multor modele înguste, dar servirea lui pentru sarcini simple poate fi o risipă. Dirijarea cererilor comune către un model mai mic și rezervarea sistemului mare pentru lucrări dificile pot reduce cererea continuă.
Modelele mici AI folosesc mai puțină energie? examinează de ce răspunsul este în general da pentru o sarcină comparabilă, în timp ce capacitatea și reîncercările aparțin încă în total.
Contabilitatea carbonului schimbă ambele părți
Două curse de antrenament cu energie egală pot avea emisii diferite pe rețele diferite. Inferența poate fi distribuită geografic, astfel încât intensitatea sa de carbon poate varia în funcție de regiuni și ore. Contractele de energie regenerabilă pot modifica raportarea companiei bazată pe piață fără a modifica mixul fizic al rețelei în fiecare moment.
Emisiile încorporate complică și mai mult diviziunea. Ar trebui să producă un cluster de antrenament să fie atribuită instruirii, chiar dacă hardware-ul servește ulterior deducerii? Cum ar trebui să fie alocată clădirea unui centru de date partajat între AI și sarcinile de lucru convenționale? Nu există un răspuns fără context.
The Amprenta de carbon AI este prin urmare mai larg decât antrenamentul plus electricitatea de inferență. Cipurile, clădirile și lanțurile de aprovizionare trebuie să apară undeva într-o evaluare a ciclului de viață complet.
De ce prognozele de sistem rareori le separă clar
Planificatorii rețelei văd cererea de instalații. Un centru de date poate antrena un model în timp ce deservește mai multe altele și rulează sarcini de lucru în cloud non-AI. Anunțurile publice privind capacitatea nu dezvăluie întotdeauna utilizarea sau mixul volumului de muncă.
Agenția Internațională pentru Energie estimează că centrele de date globale au folosit aproximativ 415 TWh în 2024 și proiectează aproximativ 945 TWh în 2030 în cazul său de bază. Acesta identifică serverele accelerate, conduse în principal de AI, ca o sursă majoră de creștere. Aceste cifre conțin instruire, inferență și servicii non-AI, mai degrabă decât o împărțire curată.
Această vedere combinată este potrivită pentru planificarea energiei electrice. Nu poate spune unui utilizator cât de mult dintr-un răspuns aparține unui antrenament trecut.
Pe ce emisii ar trebui să vă concentrați?
Dezvoltatorii de modele ar trebui să dezvăluie energia de formare, locația, hardware-ul și domeniul de dezvoltare; îmbunătățirea eficienței antrenamentului; și evitați rulările duplicate inutile. Operatorii de servicii ar trebui să urmărească inferența, să utilizeze modele de dimensiuni adecvate, să sporească gradul de utilizare, să reducă jetoanele inutile și să obțină energie electrică cu emisii reduse de carbon. Emisiile din hardware și din construcții au nevoie de propriile planuri de reducere.
Utilizatorii au mai multă influență asupra inferenței: alegerea unui model potrivit, limitarea producției inutile și evitarea generațiilor repetate. Ele nu pot schimba retroactiv cursa de instruire, dar cererea poate influența ce furnizori de sisteme implementează.
Treechat Chitanța pe răspuns a lui estimează inferența operațională, mai degrabă decât alocarea antrenamentului istoric sau a emisiilor încorporate. Utilizează modele și numere de simboluri cu ipoteze publicate pentru centrele de date și grila. Acea graniță mai îngustă este explicită la noi pagina de metodologie.
Antrenament versus inferență nu este un concurs cu un câștigător permanent. Raportați separat faza inițială concentrată, faza operațională de acumulare și ciclul de viață mai larg. Apoi, deciziile pot viza emisiile pe care le pot schimba efectiv.