Treechat
Menu
Experimentar grátis
Todas as notas

Quanta energia um ChatGPT consulta usar?

A resposta honesta é um intervalo, não um único número. Aqui está o que é público, o que é estimado e o que fica de fora.

Por Treechat7 min de leitura
Uma única fita de prompt passa por um processador e um medidor de energia física.

A resposta curta é que uma consulta de texto normal provavelmente usa uma fração de watt-hora, mas não existe “ChatGPT consulta”. Uma solicitação para corrigir uma frase e uma tarefa de pesquisa profunda que lê dezenas de fontes são trabalhos de computação diferentes. Tratá-los como intercambiáveis ​​torna qualquer figura precisa menos útil do que parece.

Isso não significa que não sabemos nada. Em 2025, OpenAI o presidente-executivo Sam Altman escreveu que uma média ChatGPT consulta usa sobre 0.34 watt-hora. Na mesma época, pesquisadores independentes da Epoch AI estimaram aproximadamente 0.3 watt-hora para um típico GPT-4o consulta. O acordo é notável, mas não é o mesmo que uma medição pública auditada de forma independente. Altman não publicou o cálculo por trás de seu número, enquanto a Epoch teve que fazer suposições sobre o modelo, hardware, utilização e contagem de tokens.

Portanto, 0.3–0.34 Wh é um ponto de referência útil para uma troca de texto comum do tipo que essas estimativas descrevem. Não é uma leitura do medidor para seu prompt específico e não deve ser esticada para cobrir todos os modos ou modelos.

Por que uma consulta pode ser muito diferente de outra

Uma resposta de IA é gerada token por token. Em termos gerais, mais insumos para processar e mais resultados para gerar significam mais trabalho. Uma resposta curta e factual pode terminar rapidamente. Uma longa conversa leva adiante o contexto anterior. Carregar um documento substancial adiciona um custo inicial de processamento. Um modelo de raciocínio pode gerar tokens de trabalho ocultos antes de mostrar uma resposta. Ferramentas de pesquisa, geração de imagens e agentes podem chamar vários sistemas em vez de um.

Os exemplos trabalhados da Epoch deixam claro o tamanho dessa variação. Seu modelo colocou uma consulta com uma entrada de 10,000 tokens em torno de 2.5 Wh e um com entrada de 100,000 tokens perto de 40 Wh, sob suas suposições declaradas. Essas não são estimativas para o chat médio. Eles mostram por que a palavra “consulta” é muito grosseira por si só.

O modelo também importa. Um modelo menor geralmente realiza menos cálculos por token gerado do que um modelo grande, embora a arquitetura, a quantização e a otimização de hardware e software compliquem a comparação. Os modelos de mistura de especialistas ativam apenas parte de sua contagem total de parâmetros para cada token. Os aceleradores modernos podem realizar mais trabalho por unidade de eletricidade do que os hardwares mais antigos. O lote eficiente permite que um servidor lide com vários usuários juntos, mas um servidor vazio ou pouco usado pode ser menos eficiente por resposta.

Depois, há o data center em torno dos chips. O resfriamento, a rede e a conversão de energia também consomem eletricidade. Os pesquisadores geralmente consideram essa sobrecarga um fator de eficácia no uso de energia. O resultado também depende de onde e quando a eletricidade é gerada: um watt-hora tem a mesma energia em todos os lugares, mas as emissões associadas variam de acordo com a combinação da rede.

O que realmente está sendo contado?

A maioria dos números por consulta descreve a eletricidade operacional para inferência: a energia usada enquanto o serviço produz uma resposta, além de alguma margem para despesas gerais do data center. Eles não podem incluir o telefone ou laptop do usuário, transmissão de rede, armazenamento, treinamento de modelo, fabricação de chips e edifícios ou infraestrutura mantida pronta entre solicitações.

Não existe um único limite correto para cada questão. Se você estiver comparando duas opções de inferência, a energia operacional por resposta será útil. Se você estiver preparando um inventário de carbono para toda a empresa, um limite de ciclo de vida mais amplo pode ser mais apropriado. Os problemas começam quando uma estimativa restrita é apresentada como o custo ambiental total – ou quando uma estimativa ampla é comparada com uma estimativa restrita.

O treinamento merece tratamento separado. É um trabalho grande e ocasional cujo impacto pode ser atribuído a um número desconhecido de utilizações futuras. Divida-o por mais mensagens e seu compartilhamento por mensagem diminuirá; incluem um modelo que é rapidamente substituído e sobe. Uma alocação pode ajudar na contabilidade, mas não é a eletricidade consumida no momento em que você clica em enviar.

O mesmo cuidado se aplica à água e ao carbono. O uso da água depende da tecnologia de refrigeração e da cadeia de abastecimento de eletricidade. O carbono depende da localização, do momento e se a contabilização utiliza a combinação da rede física ou compras contratuais de energia renovável. Converter Wh em gramas de carbono sem indicar essas escolhas esconde uma incerteza importante.

Como o antigo número de 3 Wh viajou

Durante vários anos, os artigos diziam frequentemente uma ChatGPT solicitação usou cerca de 3 Wh, às vezes combinada com a alegação de que isso era dez vezes por Google pesquisa. O número veio de uma estimativa inicial usando hardware A100 mais antigo, um GPT-3.5-scale modelo e 2,000 tokens de saída assumidos. A Epoch AI explica por que considera essas suposições não representativas do uso moderno típico em sua metodologia e comparação.

Atualizar uma estimativa quando o hardware e os serviços mudam é uma boa prática. Isso não prova que o uso de energia da IA ​​seja irrelevante. Isso significa que um número popular por consulta envelheceu mal.

A comparação com a pesquisa na web é instável por outro motivo: o número de pesquisa comumente citado veio de Google em 2009. A pesquisa envolve agora diferentes infra-estruturas e por vezes inclui resumos gerados. Colocar uma estimativa recente de IA ao lado de uma estimativa de pesquisa antiga cria uma proporção aparentemente simples a partir de medições diferentes.

Como os números são mal utilizados em ambas as direções

Um uso indevido é pegar uma estimativa sofisticada ou desatualizada, multiplicá-la por um grande número de solicitações imaginadas e apresentar o resultado como um total medido. Isso pode exagerar o uso comum de texto e desviar a atenção das cargas de trabalho que são genuinamente mais intensas.

O uso indevido oposto começa com uma média baixa e conclui que não há nada a considerar. Uma pequena quantidade multiplicada pelo uso grande e crescente ainda representa a demanda do sistema. O O trabalho da Agência Internacional de Energia sobre energia e IA analisa a demanda do data center nesse nível do sistema. A eficiência por consulta e o crescimento total da eletricidade podem ser verdadeiros quando o uso se expande e novas tarefas exigem mais computação.

Outro erro é a falsa precisão. “0.34 Wh” parece medido com duas casas decimais, mas a declaração pública descreve uma média de uma mistura não revelada de solicitações. É mais honesto reter o contexto e a incerteza do que transformá-los numa constante universal.

Como Treechat estima uma mensagem

Treechat não consegue ler um medidor de potência anexado a cada resposta. Os provedores não expõem essa medição. Em vez disso, estimamos e rotulamos o resultado como uma estimativa.

Nosso cálculo começa com o modelo utilizado e os tokens processados e gerados. Aplica uma metodologia energética baseada em modelos públicos, acrescenta despesas gerais ao centro de dados e converte eletricidade em emissões estimadas utilizando uma intensidade média de carbono da rede. As suposições e constantes atuais são definidas em nosso página de metodologia.

Encaminhamos as solicitações diárias para um modelo menor por padrão porque a escolha do modelo é uma alavanca que podemos realmente usar. Também mostramos um recebimento estimado da resposta, em vez de reivindicar uma medida exata. Onde as evidências são incompletas, voltamo-nos contra nós mesmos. Preferimos subestimar uma poupança do que fazer uma promessa clara que os dados subjacentes não podem sustentar.

A resposta mais defensável, então, não é “um ChatGPT consulta usa exatamente X". É: consultas de texto comuns parecem ocupar cerca de uma fração de watt-hora de acordo com estimativas públicas recentes, enquanto contexto longo, raciocínio e trabalho pesado em ferramentas podem usar muito mais. Pergunte qual modelo, quantos tokens, qual hardware e qual limite. Sem esses detalhes, o número é uma indicação, não um fato sobre cada consulta.

Quanta energia um ChatGPT consulta usar? · Treechat blog