De ce AI folosește atât de multă energie?
AI transformă solicitările în miliarde de calcule, mută datele modelului prin memorie și rulează în centrele de date consumatoare de energie. Aici se duce energia.

Inteligența artificială folosește energie substanțială, deoarece producerea unui răspuns necesită multe operații numerice pe cipuri specializate, mută în mod repetat datele modelului prin memorie, apoi susține acel hardware cu rețea, conversie de putere și răcire. Modelele mari, solicitările lungi și ieșirile lungi necesită, în general, mai multă muncă. Antrenamentul adaugă un cost de energie separat, concentrat; deservirea a milioane de cereri ulterioare adaugă una continuă.
Nu toate sarcinile AI sunt mari. Un model text mic care răspunde la o întrebare scurtă poate folosi o fracțiune de watt-oră conform estimărilor recente. Preocuparea este combinația de modele pretențioase, utilizare în creștere și facilități construite la o densitate de putere neobișnuită. Agenția Internațională pentru Energie spune că serverele accelerate, determinate în principal de adoptarea AI, sunt o sursă majoră de creștere a energiei electrice proiectate în centrele de date Analiza energiei și AI.
Un răspuns este un lanț de calcule
Modelele de limbaj stochează relațiile numerice învățate în parametri. Când sosește un prompt, procesoarele combină intrarea cu acei parametri prin operații cu matrice mari. Modelul prezice apoi un simbol, îl adaugă în context și repetă procesul pentru următorul simbol.
Această buclă token-cu-token este motivul pentru care lungimea ieșirii contează. A cere un răspuns concis și a cere o carte nu sunt aceeași treabă. Intrările contează și ele: o conversație lungă sau un document încărcat trebuie procesat înainte și în timpul generării. Unele sisteme de raționament produc și token-uri interne pe care utilizatorul nu le vede niciodată.
Electricitatea exactă depinde de mai mult decât numărul de parametri. Arhitectura modelului, precizia numerică, accesul la memorie, nucleele software și generarea acceleratorului, toate afectează cât de multă muncă utilă este livrată pe watt.
Cipul nu pur și simplu „cunoaște” modelul fără muncă fizică. Parametrii și valorile intermediare trebuie să se deplaseze între memoria cu lățime de bandă mare și procesoare. Capacitatea memoriei și lățimea de bandă pot deveni constrângeri, în special pentru modelele mari. Menținerea hardware-ului alimentat cu date costă energie chiar și atunci când aritmetica în sine este foarte optimizată.
Acest lucru ajută la explicarea de ce un model mai mic sau comprimat poate fi eficient. Dacă trebuie citite mai puține greutăți și efectuate mai puține operațiuni pentru fiecare jeton, volumul de lucru poate scădea. Modelele de amestec de experți pot activa, de asemenea, doar o parte din parametrii lor totali pentru un simbol, deși designul de rutare și de servire încă contează.
Întrebarea practică este acoperită în modelele mici AI folosesc mai puțină energie?. Dimensiunea este un semnal important, dar nu este o măsurătoare completă a puterii.
Hardware-ul AI este dens în putere
Acceleratoarele moderne sunt proiectate pentru a efectua un număr enorm de operații în paralel. Un rack plin cu ele poate consuma mult mai multă putere decât un rack de servere convenționale. De asemenea, instruirea și servirea conectează multe cipuri prin rețele rapide, care adaugă propria cerere de energie electrică.
IEA observă că centrele de date concentrate pe IA pot avea încărcături foarte mari, concentrate geografic. Acest lucru creează o problemă de planificare diferită de aceeași cantitate de consum împrăștiată într-o țară. Conexiunile la rețea, substațiile și generarea trebuie să fie disponibile la locul și momentul potrivit.
EPRI-uri Powering Intelligence scenarii reflectă incertitudinea: cererea viitoare a centrelor de date din SUA se modifică pe scară largă în funcție de ipotezele de dezvoltare și utilizare. Prin urmare, previziunile privind energia electrică sunt citite cel mai bine ca căi condiționate, nu ca promisiuni.
Clădirea din jurul cipurilor folosește și energie
Serverele sunt doar o parte a unui centru de date. Răcirea elimină căldura. Pompele și ventilatoarele mișcă aerul sau lichidul. Sistemele de alimentare convertesc electricitatea și oferă rezervă. Stocarea, procesoarele convenționale și echipamentele de rețea coordonează volumul de lucru.
Analiștii rezumă adesea această suprasarcină cu eficiența utilizării energiei sau PUE: energia totală a instalației împărțită la energia electrică utilizată de echipamentele IT. Un PUE de 1 ar însemna nicio taxă generală, ceea ce facilitățile reale nu le pot realiza. Un PUE mai mic este mai bine, dar nu spune cât de eficient este modelul AI în sine.
Această limită contează atunci când se compară costul energiei unui mesaj AI. O estimare numai pentru cip și o estimare la nivel de instalație pot diferi chiar dacă ambele calcule sunt solide la nivel intern.
Antrenamentul este mare; inferența este necruțătoare
Antrenamentul expune un model la seturi de date uriașe și își actualizează parametrii pe mai multe procesoare. Poate rula zile sau mai mult, cu experimente și curse de antrenament eliminate adăugând muncă dincolo de rularea finală de succes. Totalurile publice sunt rare, iar compararea cifrelor de formare este dificilă atunci când hardware-ul, locația și limitele contabile diferă.
Inferența este mai mică pentru fiecare sarcină, dar se întâmplă de fiecare dată când cineva întreabă. Un model intens utilizat poate consuma în cele din urmă mai mult prin inferență decât prin antrenament; un model puțin folosit nu poate. Funcțiile care efectuează apeluri multiple — căutare, agenți, analiză de imagini sau autoverificare repetată — pot transforma o acțiune vizibilă în mai multe joburi backend.
Acesta este motivul pentru care „un prompt” nu este o unitate tehnică durabilă. Ceea ce face serviciul după solicitare este cel puțin la fel de important ca și cuvintele tastate înainte.
O IA mai eficientă poate însemna totuși mai multă energie electrică
Eficiența AI se îmbunătățește prin cipuri mai bune, cuantizare, sparsitate, loturi și design de model. Luccioni, Jernite și Strubell’s compararea sarcinilor de lucru de inferență arată, de asemenea, că alegerea sarcinii și a modelului contează: sistemele generative de uz general pot necesita mult mai multă energie decât modelele specifice sarcinilor pentru sarcinile evaluate.
Cu toate acestea, un răspuns mai ieftin poate duce la mai multe răspunsuri. AI este adăugată la căutare, software de birou, codare, asistență pentru clienți și generare media. Cererea totală crește dacă numărul de sarcini crește mai repede decât scade energia per sarcină. Acesta este modul în care eficiența îmbunătățită și creșterea consumului de energie electrică pot fi atât adevărate.
Cazul de bază al AIE prevede că consumul global de energie electrică din centrele de date va crește de la aproximativ 415 TWh în 2024 la aproximativ 945 TWh în 2030. Acesta atribuie creșterea AI, precum și altor servicii digitale, astfel încât totalul nu ar trebui redenumit doar ca AI.
Ce utilizatori și servicii se pot schimba
La nivel de serviciu, pârghiile principale sunt alegerea celui mai mic model capabil, îmbunătățirea utilizării, limitarea apelurilor inutile de instrumente, utilizarea hardware-ului eficient și localizarea lucrărilor flexibile acolo unde este disponibilă electricitate cu emisii reduse de carbon. La nivelul utilizatorului, solicitările concise, limitele sensibile de ieșire și utilizarea software-ului obișnuit atunci când face treaba poate evita calculele inutile.
Treechat direcționează întrebările de zi cu zi către un model mai mic și estimează energia fiecărui răspuns din utilizarea modelului și a simbolului. Chitanța include o alocație declarată pentru cheltuielile generale ale centrului de date; rămâne o estimare deoarece furnizorii nu expun un contor pentru fiecare răspuns. Al nostru metodologie enumeră ipotezele curente.
Inteligența artificială folosește energia din motive fizice înțelese, nu pentru că indicațiile sunt transformate în mod misterios în poluare. Răspunsul util este de a face munca de calcul vizibilă, de a o reduce acolo unde este posibil și de a rezerva sisteme mai mari pentru munca care are cu adevărat nevoie de ele.