Treechat
Meny
Prova gratis
Alla anteckningar

Energikostnaden för ett AI-meddelande

Ett vanligt AI-textmeddelande använder sannolikt en bråkdel av en wattimme, men modell, tokens, verktyg och redovisningsgränser gör utbudet brett.

Av Treechat5 min läsning
Ett meddelandeband rör sig genom en kompakt processor och en liten fysisk elmätare.

För ett normalt textutbyte tyder de bästa offentliga uppskattningarna på en energikostnad på ungefär en bråkdel av en wattimme – inte ett fast belopp för varje AI-meddelande. OpenAI vd Sam Altman har angett ett genomsnitt ChatGPT fråga använder om 0.34 wattimmar, medan Epoch AI oberoende uppskattade ca 0.3 Wh för en typisk GPT-4o fråga.

Dessa siffror är användbara referenspunkter, inte direkta mätningar av ditt budskap. En omskrivning på två rader, en lång dokumentanalys och en verktygsanvändande forskningsuppgift kan alla se ut som en sändningsåtgärd samtidigt som de kräver mycket olika mängder datoranvändning. Modell, ingångslängd, utdatalängd, dolda resonemang, hårdvara och datacenterkostnader påverkar alla totalen.

"Ett meddelande" döljer flera enheter

Ett meddelande har en ingång: din nya uppmaning, systeminstruktioner och ofta tidigare konversation. Den har också en utgång som genereras en token i taget. Längre indata behöver mer bearbetning; längre utgångar gör att modellen fungerar för fler generationssteg.

Det synliga meddelandet kan utlösa mer än ett modellanrop. Webbforskning kan söka, hämta sidor, syntetisera dem och kontrollera resultatet. En agent kan skriva kod, inspektera ett fel och försöka igen. Bildskapande använder en annan beräkningsprocess än text. Ett servicegenomsnitt blandar en blandning av dessa jobb, medan en bearbetad uppskattning vanligtvis beskriver en viss.

Innan du använder en siffra per meddelande, fråga vilken typ av meddelande den representerar. Utan den definitionen är enheten bekväm men svag.

Var bråkdelen av en wattimme uppskattning kommer ifrån

Altmans 0.34 Wh-nummer är ett företagsuttalande utan en publicerad beräkning. Epochs ungefär 0.3 Wh-siffra är en modellerad uppskattning med antaganden om GPT-4o, hårdvara, användning och ett typiskt antal tokens. Enighet mellan dem är betryggande, men det är inte detsamma som oberoende tillgång till OpenAI s effektmätare.

Epoch modellerade också hur längre sammanhang ändrar resultatet. Dess exempel ökar markant för inmatningar av tiotusentals tokens. Det gör inte dessa exempel typiska; det visar varför en universell konstant misslyckas.

Vår djupare genomgång av hur mycket energi a ChatGPT fråga använder förklarar antagandena och varför vanlig text inte bör användas som proxy för varje AI-funktion.

Varför den gamla 3 Wh-uppskattningen är en dålig standard

I åratal upprepade artiklar en uppskattning på ca 3 Wh per ChatGPT fråga. Det kom från antaganden som involverade äldre hårdvara, en GPT-3.5-scale modell och en mycket lång utgång. epok jämförelse med tidigare uppskattningar hävdar att dessa ingångar inte representerar en typisk modern chatt.

Lärdomen är inte att allt tidigare arbete var dumt. Uppskattningar måste välja en modell, hårdvarugenerering och begäranform, och dessa indata åldras snabbt. Felet kommer när ett scenario blir ett evigt faktum.

Det omvända misstaget är att behandla det nyare låga genomsnittet som ett bevis på att all AI-användning är försumbar. Den totala efterfrågan beror också på antalet meddelanden och ankomsten av mer intensiva funktioner.

En wattimme mäter energi. Den berättar inte vilket kraftverk som levererade den eller vilka utsläpp som är förknippade med produktion. Att omvandla el till kol kräver ett antagande om kolintensitet i nätet kopplat till en plats och helst en tid. Företagskontrakt för förnybar energi lägger till ytterligare ett redovisningsskikt.

Vatten är annorlunda igen. Vissa anläggningar använder vatten direkt för kylning, medan elproduktion kan ha ett indirekt vattenavtryck. Kyldesign, klimat och rutnät blandar allt. Det är missvisande att koppla en universell vattenmängd till varje AI-meddelande av samma anledning som ett universellt energinummer misslyckas.

AI koldioxidavtryck förklaras separerar driftel från inbyggda utsläpp i flis och byggnader, som normalt ligger utanför en uppskattning per meddelande slutledning.

Mindre modeller kan förändra kostnaden

För samma tokenantal och jämförbara serveringsförhållanden utför en mindre modell i allmänhet mindre beräkning än en stor tät modell. Kvantisering, blandning av expertarkitekturer och nyare chips kan minska arbetet ytterligare. Effektiv batchning kan dela infrastruktur över flera förfrågningar.

Men användbar produktion är viktig. Om en liten modell misslyckas och användaren upprepar uppmaningen fyra gånger innan han byter till en större, kanske det nominellt effektiva valet inte minimerar hela uppgiften. En smal specialiserad modell kan vara både mindre och bättre för sitt avsedda arbete; en svår resonemangsuppgift kan motivera ett större system.

Det är därför energianvändning av små modeller bör övervägas vid sidan av uppgiftspassning, används inte som regel att det minsta alternativet alltid vinner.

Det som normalt utelämnas

De flesta meddelandeuppskattningar täcker inferenselektricitet och ibland datacenteroverhead. De utelämnar vanligtvis utbildning, modellutvecklingsexperiment, chiptillverkning, datacenterkonstruktion, nätverksutrustning utanför anläggningen och användarens enhet. De kan också utelämna ledig kapacitet som hålls redo för toppefterfrågan.

Det finns ingen obligatorisk gräns för varje fråga. Driftenergi är lämplig när man jämför två sätt att betjäna ett svar. Livscykelpåverkan är mer lämplig när man bedömer ett företag eller en modell över tid. Det viktiga är att namnge gränsen och inte presentera en snäv uppskattning som ett fullständigt fotavtryck.

I systemskala, IEA:s datacenters elutsikter inkluderar efterfrågan på infrastruktur och projekterar stark tillväxt, med AI en viktig drivkraft. Det ger inte en universell meddelandekonvertering.

Hur Treechat beräknar sitt kvitto

Treechat uppskattar snarare än mäter varje svar. Beräkningen använder den valda modellen, antal inmatade och utgående tokens, och lägger sedan till en publicerad datacenteroverheadfaktor. Den omvandlar den energin till beräknade utsläpp med ett angivet genomsnittligt nätantagande. Konstanterna, avrundningsmetoden och kända utelämnanden är på vår metodsida.

Det kvittot är bäst att läsa jämförande: ett kortare svar från en mindre modell bör vanligtvis visa mindre uppskattad driftenergi än ett långt svar från en större. Det är inte tillräckligt exakt för att intyga den fullständiga livscykeleffekten av någondera.

Så energikostnaden för ett vanligt AI-sms är troligen runt en bråkdel av en wattimme enligt de senaste offentliga uppskattningarna. För ett specifikt meddelande är det ärliga svaret ett modellerat intervall format av vad systemet faktiskt gjorde efter att du tryckte på skicka.