Le coût énergétique d’un message d’IA
Un message texte d’IA ordinaire utilise probablement une fraction de wattheure, mais le modèle, les jetons, les outils et les limites comptables élargissent la gamme.

Pour un échange de texte normal, les meilleures estimations publiques récentes suggèrent un coût énergétique d’environ une fraction de wattheure – et non un montant fixe pour chaque message d’IA. OpenAI le directeur général Sam Altman a déclaré une moyenne ChatGPT requête utilise à propos 0.34 wattheures, tandis qu'Epoch AI a estimé de manière indépendante environ 0.3 Wh pour un typique GPT-4o requête.
Ces chiffres sont des points de référence utiles et non des mesures directes de votre message. Une réécriture sur deux lignes, une longue analyse de document et une tâche de recherche utilisant un outil peuvent toutes ressembler à une seule action d'envoi tout en nécessitant des quantités de calcul très différentes. Le modèle, la longueur d’entrée, la longueur de sortie, le raisonnement caché, le matériel et les frais généraux du centre de données affectent tous le total.
« Un message » cache plusieurs unités
Un message contient une entrée : votre nouvelle invite, les instructions du système et souvent une conversation précédente. Il a également une sortie, générée un jeton à la fois. Les entrées plus longues nécessitent plus de traitement ; des sorties plus longues permettent au modèle de fonctionner pendant plus d'étapes de génération.
Le message visible peut déclencher plusieurs appels de modèle. La recherche sur le Web permet de rechercher, de récupérer des pages, de les synthétiser et de vérifier le résultat. Un agent peut écrire du code, inspecter une erreur et réessayer. La création d'images utilise un processus informatique différent de celui du texte. Une moyenne de service mélange une certaine combinaison de ces emplois, tandis qu'une estimation travaillée en décrit généralement un en particulier.
Avant d’utiliser un chiffre par message, demandez quel type de message il représente. Sans cette définition, l’unité est pratique mais faible.
D’où vient l’estimation de la fraction de wattheure
Le chiffre de 0.34 Wh d’Altman est une déclaration de l’entreprise sans calcul publié. Le chiffre d’environ 0.3 Wh d’Epoch est une estimation modélisée avec des hypothèses sur GPT-4o, le matériel, l'utilisation et un nombre typique de jetons. L'accord entre eux est rassurant, mais ce n'est pas la même chose qu'un accès indépendant à OpenAI les wattmètres.
Epoch a également modélisé la durée pendant laquelle le contexte modifie le résultat. Ses exemples augmentent sensiblement pour les entrées de dizaines de milliers de jetons. Cela ne rend pas ces exemples typiques ; cela démontre pourquoi une constante universelle échoue.
Notre examen plus approfondi de combien d'énergie un ChatGPT utilisations des requêtes explique les hypothèses et pourquoi le texte ordinaire ne doit pas être utilisé comme proxy pour chaque fonctionnalité de l'IA.
Pourquoi l'ancienne estimation de 3 Wh est une mauvaise valeur par défaut
Pendant des années, les articles ont répété une estimation d'environ 3 Wh par ChatGPT requête. Cela provenait d'hypothèses impliquant du matériel plus ancien, un GPT-3.5-scale modèle et une sortie très longue. L'époque comparaison avec des estimations antérieures soutient que ces entrées ne représentent pas un chat moderne typique.
La leçon n’est pas que tous les travaux antérieurs étaient insensés. Les estimations doivent choisir un modèle, une génération de matériel et une forme de demande, et ces entrées vieillissent rapidement. L'erreur survient lorsqu'un scénario devient un fait éternel.
L’erreur inverse consiste à considérer la nouvelle moyenne basse comme une preuve que toute utilisation de l’IA est négligeable. La demande totale dépend également du nombre de messages et de l'arrivée de fonctionnalités plus intensives.
Un wattheure mesure l’énergie. Il ne vous dit pas quelle centrale électrique l'a fourni ni les émissions associées à la production. La conversion de l’électricité en carbone nécessite une hypothèse d’intensité carbone du réseau liée à un emplacement et, idéalement, à une heure. Les contrats d’énergie renouvelable des entreprises ajoutent une autre couche comptable.
L'eau est encore différente. Certaines installations utilisent l’eau directement pour le refroidissement, tandis que la production d’électricité peut avoir une empreinte eau indirecte. La conception du système de refroidissement, le climat et la combinaison de réseaux comptent tous. Il est trompeur d’attacher une quantité d’eau universelle à chaque message d’IA pour la même raison qu’un numéro d’énergie universel échoue.
L'empreinte carbone de l'IA expliquée sépare l'électricité opérationnelle des émissions intrinsèques dans les puces et les bâtiments, qui sont normalement en dehors d'une estimation d'inférence par message.
Des modèles plus petits peuvent modifier le coût
Pour le même nombre de jetons et des conditions de diffusion comparables, un modèle plus petit effectue généralement moins de calculs qu'un grand modèle dense. La quantification, les architectures mixtes et les puces plus récentes peuvent réduire encore davantage le travail. Un traitement par lots efficace peut partager l’infrastructure sur plusieurs requêtes.
Mais les résultats utiles sont importants. Si un petit modèle échoue et que l'utilisateur répète l'invite quatre fois avant de passer à un plus grand, le choix nominalement efficace peut ne pas minimiser l'ensemble de la tâche. Un modèle spécialisé étroit peut être à la fois plus petit et mieux adapté à la tâche prévue ; une tâche de raisonnement difficile peut justifier un système plus vaste.
C'est pourquoi consommation d'énergie des petits modèles doit être considéré parallèlement à l'adéquation à la tâche, et non utilisé comme une règle selon laquelle la plus petite option gagne toujours.
Ce qui est normalement laissé de côté
La plupart des estimations de messages couvrent l'électricité d'inférence et parfois les frais généraux du centre de données. Ils laissent généralement de côté la formation, les expériences de développement de modèles, la fabrication de puces, la construction de centres de données, les équipements réseau extérieurs à l’installation et l’appareil de l’utilisateur. Ils peuvent également omettre la capacité inutilisée, prête à répondre aux pics de demande.
Il n’y a pas de limite obligatoire unique pour chaque question. L’énergie opérationnelle est appropriée lorsqu’on compare deux manières de répondre à une intervention. L’impact sur le cycle de vie est plus approprié lors de l’évaluation d’une entreprise ou d’un modèle au fil du temps. Ce qui compte, c'est de nommer la limite et de ne pas présenter une estimation étroite comme une empreinte complète.
À l’échelle du système, l’AIE perspectives électriques pour les centres de données comprend la demande d’infrastructures et les projets à forte croissance, avec l’IA comme moteur majeur. Il ne fournit pas de conversion universelle des messages.
Comment Treechat calcule sa réception
Treechat estime plutôt que mesure chaque réponse. Le calcul utilise le modèle sélectionné, le nombre de jetons d'entrée et de sortie, puis ajoute un facteur de surcharge publié pour le centre de données. Il convertit cette énergie en émissions estimées avec une hypothèse de réseau moyenne déclarée. Les constantes, l'approche des arrondis et les omissions connues sont sur notre page méthodologie.
Il est préférable de lire ce reçu de manière comparative : une réponse plus courte d'un modèle plus petit devrait généralement montrer une énergie opérationnelle estimée inférieure à une réponse longue d'un modèle plus grand. Il n’est pas suffisamment précis pour certifier l’impact de l’un ou l’autre sur l’ensemble du cycle de vie.
Ainsi, le coût énergétique d’un message texte ordinaire IA se situe probablement autour d’une fraction d’un wattheure selon les récentes estimations publiques. Pour un message spécifique, la réponse honnête est une plage modélisée façonnée par ce que le système a réellement fait après que vous ayez appuyé sur Envoyer.