Il costo energetico di un messaggio AI
Un normale messaggio di testo AI probabilmente utilizza una frazione di wattora, ma il modello, i token, gli strumenti e i limiti contabili ampliano la gamma.

Per un normale scambio di messaggi, le migliori stime pubbliche recenti suggeriscono un costo energetico di circa una frazione di wattora, non un importo fisso per ogni messaggio AI. OpenAI l'amministratore delegato Sam Altman ha dichiarato una media ChatGPT la query utilizza circa 0.34 wattora, mentre Epoch AI ha stimato in modo indipendente circa 0.3 Wh per un tipico GPT-4o domanda.
Queste cifre sono punti di riferimento utili, non misurazioni dirette del tuo messaggio. Una riscrittura di due righe, una lunga analisi di un documento e un'attività di ricerca che utilizza strumenti possono sembrare tutte un'unica azione di invio pur richiedendo quantità di elaborazione molto diverse. Modello, lunghezza di input, lunghezza di output, ragionamento nascosto, hardware e sovraccarico del data center influiscono tutti sul totale.
“Un messaggio” nasconde diverse unità
Un messaggio contiene un input: il tuo nuovo prompt, le istruzioni di sistema e spesso la conversazione precedente. Ha anche un output, generato un token alla volta. Gli input più lunghi richiedono una maggiore elaborazione; risultati più lunghi mantengono il modello funzionante per più passaggi di generazione.
Il messaggio visibile può attivare più di una chiamata di modello. La ricerca sul web può cercare, recuperare pagine, sintetizzarle e verificare il risultato. Un agente potrebbe scrivere codice, verificare un errore e riprovare. La creazione di immagini utilizza un processo computazionale diverso dal testo. Una media del servizio unisce un mix di questi lavori, mentre una stima elaborata di solito ne descrive uno particolare.
Prima di utilizzare una cifra per messaggio, chiedi che tipo di messaggio rappresenta. Senza tale definizione, l’unità è conveniente ma debole.
Da dove viene la stima della frazione di wattora
Il numero 0.34 Wh di Altman è una dichiarazione aziendale senza un calcolo pubblicato. Il valore di circa 0.3 Wh di Epoch è una stima modellata con ipotesi circa GPT-4o, hardware, utilizzo e un numero tipico di token. L'accordo tra loro è rassicurante, ma non equivale ad un accesso indipendente OpenAI i misuratori di potenza.
Epoch ha anche modellato il modo in cui un contesto più lungo cambia il risultato. I suoi esempi aumentano notevolmente per input di decine di migliaia di token. Ciò non rende tipici quegli esempi; dimostra perché una costante universale fallisce.
La nostra revisione più approfondita di quanta energia a ChatGPT usi della query spiega i presupposti e perché il testo ordinario non dovrebbe essere utilizzato come proxy per ogni funzionalità dell'intelligenza artificiale.
Perché la vecchia stima di 3 Wh è un valore predefinito inadeguato
Per anni gli articoli hanno ripetuto una stima di circa 3 Wh al giorno ChatGPT domanda. Deriva da presupposti che coinvolgevano hardware più vecchio, a GPT-3.5-scale modello e un output molto lungo. Epoca confronto con le stime precedenti sostiene che questi input non rappresentano una tipica chat moderna.
La lezione non è che tutto il lavoro precedente fosse insensato. Le stime devono scegliere un modello, una generazione di hardware e una forma di richiesta e tali input invecchiano rapidamente. L'errore arriva quando uno scenario diventa un fatto eterno.
L’errore opposto è quello di considerare la nuova media bassa come una prova del fatto che tutto l’uso dell’IA è trascurabile. La domanda totale dipende anche dal numero di messaggi e dall'arrivo di funzionalità più intensive.
Un wattora misura l'energia. Non dice quale centrale elettrica lo ha fornito o le emissioni associate alla generazione. La conversione dell’elettricità in carbonio richiede un’ipotesi di intensità di carbonio della rete legata a un luogo e, idealmente, a un tempo. I contratti aziendali sulle energie rinnovabili aggiungono un altro livello contabile.
L'acqua è di nuovo diversa. Alcuni impianti utilizzano l’acqua direttamente per il raffreddamento, mentre la produzione di elettricità può avere un’impronta idrica indiretta. Il design del sistema di raffreddamento, il clima e la rete sono tutti fattori importanti. È fuorviante allegare una quantità d’acqua universale a ogni messaggio dell’IA per lo stesso motivo per cui un numero di energia universale fallisce.
Spiegazione dell'impronta di carbonio dell'IA separa l'elettricità operativa dalle emissioni incorporate nei chip e negli edifici, che normalmente sono al di fuori di una stima di inferenza per messaggio.
I modelli più piccoli possono modificare il costo
A parità di numero di token e condizioni di servizio comparabili, un modello più piccolo generalmente esegue meno calcoli rispetto a un modello grande e denso. La quantizzazione, le architetture miste di esperti e i chip più recenti possono ridurre ulteriormente il lavoro. Un batch efficiente può condividere l'infrastruttura tra diverse richieste.
Ma i risultati utili contano. Se un modello piccolo fallisce e l’utente ripete il prompt quattro volte prima di passare a uno più grande, la scelta nominalmente efficiente potrebbe non ridurre al minimo l’intero compito. Un modello specializzato ristretto può essere sia più piccolo che migliore per il lavoro previsto; un compito di ragionamento difficile può giustificare un sistema più ampio.
Questo è il motivo consumo energetico nel modello piccolo dovrebbe essere considerata insieme all'idoneità del compito, non utilizzata come regola secondo cui l'opzione più piccola vince sempre.
Ciò che normalmente viene tralasciato
La maggior parte delle stime relative ai messaggi riguardano l'elettricità dedotta e talvolta i costi generali del data center. Di solito tralasciano la formazione, gli esperimenti di sviluppo di modelli, la produzione di chip, la costruzione di data center, le apparecchiature di rete esterne alla struttura e il dispositivo dell'utente. Possono anche omettere la capacità inattiva mantenuta pronta per i picchi di domanda.
Non esiste un unico limite obbligatorio per ogni domanda. L’energia operativa è appropriata quando si confrontano due modi per fornire una risposta. L’impatto del ciclo di vita è più appropriato quando si valuta un’azienda o un modello nel tempo. Ciò che conta è nominare il confine e non presentare una stima ristretta come un’impronta completa.
Su scala di sistema, quelli dell’IEA prospettive elettriche dei data center include la domanda di infrastrutture e prevede una forte crescita, con l’intelligenza artificiale come uno dei principali motori. Non fornisce una conversione universale dei messaggi.
Come Treechat ne calcola lo scontrino
Treechat stima anziché misurare ciascuna risposta. Il calcolo utilizza il modello selezionato, i conteggi dei token di input e output, quindi aggiunge un fattore di sovraccarico del data center pubblicato. Converte quell'energia in emissioni stimate con un'ipotesi di rete media dichiarata. Le costanti, l'approccio di arrotondamento e le omissioni note si trovano sul nostro pagina della metodologia.
È meglio leggere quella ricevuta in modo comparativo: una risposta più breve da un modello più piccolo dovrebbe solitamente mostrare un’energia operativa stimata inferiore rispetto a una risposta lunga da uno più grande. Non è sufficientemente preciso per certificare l’impatto dell’intero ciclo di vita di nessuno dei due.
Pertanto, secondo le recenti stime pubbliche, il costo energetico di un normale messaggio di testo basato sull’intelligenza artificiale è plausibilmente intorno a una frazione di wattora. Per un messaggio specifico, la risposta onesta è un intervallo modellato modellato da ciò che il sistema ha effettivamente fatto dopo aver premuto Invia.