O custo de energia de uma mensagem de IA
Uma mensagem de texto comum de IA provavelmente usa uma fração de watt-hora, mas o modelo, os tokens, as ferramentas e os limites contábeis tornam o intervalo amplo.

Para uma troca normal de mensagens de texto, as melhores estimativas públicas recentes sugerem um custo de energia de aproximadamente uma fração de watt-hora – e não um valor fixo para cada mensagem de IA. OpenAI o presidente-executivo Sam Altman declarou uma média ChatGPT consulta usa sobre 0.34 watt-hora, enquanto a Epoch AI estimou independentemente cerca de 0.3 Wh para um típico GPT-4o consulta.
Esses números são pontos de referência úteis, não medidas diretas da sua mensagem. Uma reescrita de duas linhas, uma longa análise de documentos e uma tarefa de pesquisa com uso de ferramentas podem parecer uma única ação de envio, embora exijam quantidades muito diferentes de computação. Modelo, comprimento de entrada, comprimento de saída, raciocínio oculto, hardware e sobrecarga do data center afetam o total.
“Uma mensagem” esconde várias unidades
Uma mensagem tem uma entrada: seu novo prompt, instruções do sistema e, muitas vezes, conversa anterior. Ele também possui uma saída, gerada um token por vez. Entradas mais longas necessitam de mais processamento; resultados mais longos mantêm o modelo funcionando por mais etapas de geração.
A mensagem visível pode acionar mais de uma chamada de modelo. A pesquisa na web pode pesquisar, recuperar páginas, sintetizá-las e verificar o resultado. Um agente pode escrever código, inspecionar um erro e tentar novamente. A criação de imagens usa um processo computacional diferente do texto. Uma média de serviço combina alguma combinação desses empregos, enquanto uma estimativa trabalhada geralmente descreve um determinado trabalho.
Antes de usar um valor por mensagem, pergunte que tipo de mensagem ele representa. Sem essa definição, a unidade é conveniente, mas fraca.
De onde vem a estimativa da fração de watt-hora
O número de 0.34 Wh de Altman é uma declaração da empresa sem cálculo publicado. O valor de aproximadamente 0.3 Wh da Epoch é uma estimativa modelada com suposições sobre GPT-4o, hardware, utilização e um número típico de tokens. O acordo entre eles é tranquilizador, mas não é o mesmo que acesso independente a OpenAI medidores de energia.
A Epoch também modelou como o contexto mais longo altera o resultado. Seus exemplos aumentam acentuadamente para entradas de dezenas de milhares de tokens. Isso não torna esses exemplos típicos; demonstra por que uma constante universal falha.
Nossa revisão mais profunda de quanta energia um ChatGPT consulta usa explica as suposições e por que o texto comum não deve ser usado como proxy para todos os recursos de IA.
Por que a antiga estimativa de 3 Wh é um padrão ruim
Durante anos, os artigos repetiram uma estimativa de cerca de 3 Wh por ChatGPT consulta. Surgiu de suposições envolvendo hardware mais antigo, um GPT-3.5-scale modelo e uma produção muito longa. Época comparação com estimativas anteriores argumenta que essas entradas não representam um típico bate-papo moderno.
A lição não é que todo o trabalho anterior foi tolo. As estimativas devem escolher um modelo, geração de hardware e formato de solicitação, e essas entradas envelhecem rapidamente. O erro surge quando um cenário se torna um fato eterno.
O erro inverso é tratar a média baixa mais recente como prova de que todo o uso de IA é insignificante. A demanda total também depende da quantidade de mensagens e da chegada de recursos mais intensivos.
Um watt-hora mede energia. Não informa qual usina a forneceu ou as emissões associadas à geração. A conversão de eletricidade em carbono requer uma suposição de intensidade de carbono da rede vinculada a um local e, idealmente, a um momento. Os contratos de energia renovável das empresas acrescentam outra camada de contabilidade.
A água é diferente novamente. Algumas instalações utilizam água diretamente para refrigeração, enquanto a geração de eletricidade pode ter uma pegada hídrica indireta. O design de refrigeração, o clima e a rede misturam toda a matéria. É enganoso anexar uma quantidade universal de água a cada mensagem de IA pela mesma razão pela qual um número universal de energia falha.
Pegada de carbono da IA explicada separa a eletricidade operacional das emissões incorporadas em chips e edifícios, que normalmente estão fora de uma estimativa de inferência por mensagem.
Modelos menores podem alterar o custo
Para as mesmas contagens de tokens e condições de serviço comparáveis, um modelo menor geralmente executa menos computação do que um modelo grande e denso. A quantização, as arquiteturas combinadas de especialistas e os chips mais recentes podem reduzir ainda mais o trabalho. O processamento em lote eficiente pode compartilhar a infraestrutura entre diversas solicitações.
Mas os resultados úteis são importantes. Se um modelo pequeno falhar e o usuário repetir o prompt quatro vezes antes de mudar para um modelo maior, a escolha nominalmente eficiente pode não minimizar toda a tarefa. Um modelo especializado restrito pode ser menor e melhor para o trabalho pretendido; uma difícil tarefa de raciocínio pode justificar um sistema maior.
É por isso uso de energia em modelos pequenos deve ser considerada juntamente com a adequação à tarefa, e não usada como regra de que a menor opção sempre vence.
O que normalmente é deixado de fora
A maioria das estimativas de mensagens cobre a eletricidade de inferência e, às vezes, a sobrecarga do data center. Eles geralmente deixam de fora treinamento, experimentos de desenvolvimento de modelos, fabricação de chips, construção de data centers, equipamentos de rede fora das instalações e o dispositivo do usuário. Eles também podem omitir a capacidade ociosa mantida pronta para picos de demanda.
Não existe um limite obrigatório único para cada pergunta. A energia operacional é apropriada ao comparar duas maneiras de fornecer uma resposta. O impacto do ciclo de vida é mais apropriado ao avaliar uma empresa ou modelo ao longo do tempo. O que importa é nomear o limite e não apresentar uma estimativa restrita como uma pegada completa.
Na escala do sistema, a IEA perspectivas de eletricidade do data center inclui a procura de infraestruturas e projeta um forte crescimento, com a IA como principal impulsionador. Ele não fornece uma conversão universal de mensagens.
Como Treechat calcula seu recebimento
Treechat estima em vez de medir cada resposta. O cálculo usa o modelo selecionado, contagens de tokens de entrada e saída e, em seguida, adiciona um fator de sobrecarga publicado no data center. Ele converte essa energia em emissões estimadas com uma suposição de rede média declarada. As constantes, a abordagem de arredondamento e as omissões conhecidas estão em nosso página de metodologia.
Esse recibo é melhor lido comparativamente: uma resposta mais curta de um modelo menor geralmente deve mostrar menos energia operacional estimada do que uma resposta longa de um modelo maior. Não é suficientemente preciso para certificar o impacto completo do ciclo de vida de qualquer um deles.
Portanto, o custo energético de uma mensagem de texto comum de IA é plausivelmente em torno de uma fração de watt-hora, segundo estimativas públicas recentes. Para uma mensagem específica, a resposta honesta é um intervalo modelado moldado pelo que o sistema realmente fez depois que você pressionou enviar.