Treechat
Menú
Probar gratis
Todas las notas

¿Cuánta energía consume un ChatGPT uso de consulta?

La respuesta honesta es un rango, no un solo número. Esto es lo que es público, lo que se estima y lo que se omite.

Por Treechat7 min de lectura
Una única cinta de aviso pasa a través de un procesador y un medidor de energía físico.

La respuesta corta es que una consulta de texto normal probablemente utilice una fracción de vatio-hora, pero no existe una "relación universal".ChatGPT consulta". Una solicitud para fijar una oración y una tarea de investigación profunda que lee docenas de fuentes son trabajos informáticos diferentes. Tratarlos como intercambiables hace que cualquier cifra que parezca precisa sea menos útil de lo que parece.

Eso no significa que no sepamos nada. En 2025, OpenAI El director ejecutivo Sam Altman escribió que un promedio ChatGPT usos de consulta sobre 0.34 vatios-hora. Casi al mismo tiempo, investigadores independientes de Epoch AI estimaron aproximadamente 0.3 vatios-hora para un típico GPT-4o consulta. El acuerdo es notable, pero no es lo mismo que una medición pública auditada de forma independiente. Altman no publicó el cálculo detrás de su cifra, mientras que Epoch tuvo que hacer suposiciones sobre el modelo, el hardware, la utilización y el recuento de tokens.

Por tanto, 0.3–0.34 Wh es un punto de referencia útil para un intercambio de texto ordinario del tipo que describen esas estimaciones. No es una lectura de medidor para su solicitud particular y no debe ampliarse para cubrir todos los modos o modelos.

Por qué una consulta puede ser muy diferente de otra

Se genera una respuesta de IA token por token. En términos generales, más insumos para procesar y más resultados para generar significan más trabajo. Una respuesta breve y objetiva puede terminar rápidamente. Una larga conversación lleva adelante el contexto anterior. Cargar un documento sustancial agrega un costo de procesamiento inicial. Un modelo de razonamiento puede generar tokens de trabajo ocultos antes de mostrar una respuesta. Las herramientas de búsqueda, generación de imágenes y agentes pueden llamar a varios sistemas en lugar de uno.

Los ejemplos elaborados de Epoch dejan claro el tamaño de esta variación. Su modelo puso una consulta con una entrada de 10,000 tokens en aproximadamente 2.5 Wh y uno con una entrada de 100,000 tokens cerca de 40 Wh, bajo sus supuestos declarados. Esas no son estimaciones para el chat promedio. Muestran por qué la palabra “consulta” es demasiado burda por sí sola.

El modelo también importa. Un modelo más pequeño generalmente realiza menos cálculos por token generado que uno grande, aunque la arquitectura, la cuantificación y la optimización del hardware y el software complican la comparación. Los modelos de combinación de expertos activan solo una parte de su recuento total de parámetros para cada token. Los aceleradores modernos pueden realizar más trabajo por unidad de electricidad que el hardware más antiguo. El procesamiento por lotes eficiente permite que un servidor maneje varios usuarios juntos, pero un servidor vacío o poco usado puede ser menos eficiente por respuesta.

Luego está el centro de datos alrededor de los chips. La refrigeración, la conexión en red y la conversión de energía también consumen electricidad. Los investigadores suelen tener en cuenta esos gastos generales con un factor de eficacia del uso de energía. El resultado también depende de dónde y cuándo se genera la electricidad: un vatio-hora tiene la misma energía en todas partes, pero sus emisiones asociadas varían según la combinación de la red.

¿Qué se cuenta realmente?

La mayoría de las cifras por consulta describen la electricidad operativa para realizar inferencias: la energía utilizada mientras el servicio produce una respuesta, más cierta asignación para los gastos generales del centro de datos. No pueden incluir el teléfono o la computadora portátil del usuario, la transmisión de red, el almacenamiento, la capacitación del modelo, la fabricación de chips y edificios, o la infraestructura que se mantiene lista entre solicitudes.

No existe un único límite correcto para cada pregunta. Si compara dos opciones de inferencia, la energía operativa por respuesta es útil. Si está preparando un inventario de carbono para toda la empresa, puede ser más apropiado establecer un límite más amplio del ciclo de vida. Los problemas comienzan cuando se presenta una estimación restringida como el costo ambiental total, o cuando se compara una estimación amplia con una restringida.

La formación merece un tratamiento aparte. Es un trabajo grande y ocasional cuyo impacto puede distribuirse entre un número indeterminado de usos futuros. Divídalo entre más mensajes y su porcentaje por mensaje se reducirá; Incluye un modelo que se reemplaza rápidamente y sube. Una asignación puede ayudar con la contabilidad, pero no es electricidad consumida en el momento en que presiona enviar.

La misma precaución se aplica al agua y al carbono. El uso del agua depende de la tecnología de refrigeración y de la cadena de suministro de electricidad. El carbono depende de la ubicación, el momento y si la contabilidad utiliza la combinación de la red física o compras contractuales de energía renovable. Convertir Wh en gramos de carbono sin indicar esas opciones esconde una incertidumbre importante.

Cómo viajaba la antigua cifra de 3 Wh

Durante varios años, los artículos decían a menudo que ChatGPT solicitud utilizó alrededor de 3 Wh, a veces junto con la afirmación de que esto era diez veces al Google buscar. La cifra proviene de una estimación inicial que utiliza hardware A100 más antiguo, un GPT-3.5-scale modelo y se suponen 2,000 tokens de salida. Epoch AI explica por qué considera que esos supuestos no son representativos del uso moderno típico en su metodología y comparación.

Actualizar una estimación cuando cambian el hardware y los servicios es una buena práctica. No prueba que el uso de energía de la IA sea irrelevante. Significa un número popular por consulta que ha envejecido mal.

La comparación con la búsqueda web es inestable por otra razón: la cifra de búsqueda comúnmente citada proviene de Google en 2009. La búsqueda ahora implica una infraestructura diferente y, a veces, incluye resúmenes generados. Poner una estimación de IA reciente junto a una estimación de búsqueda anterior crea una relación aparentemente simple a partir de mediciones diferentes.

Cómo se utilizan mal los números en ambas direcciones

Un mal uso es tomar una estimación de alto nivel o desactualizada, multiplicarla por una gran cantidad de solicitudes imaginadas y presentar el resultado como un total medido. Eso puede exagerar el uso normal del texto y distraer la atención de las cargas de trabajo que realmente son más intensivas.

El mal uso opuesto comienza con un promedio bajo y concluye que no hay nada que considerar. Una pequeña cantidad multiplicada por un uso amplio y creciente sigue siendo demanda del sistema. El El trabajo de la Agencia Internacional de Energía en materia de energía e inteligencia artificial analiza la demanda del centro de datos a ese nivel del sistema. La eficiencia por consulta y el crecimiento total de la electricidad pueden ser ciertos cuando el uso se expande y las nuevas tareas requieren más computación.

Otro error es la falsa precisión. “0.34 Wh” suena medido con dos decimales, pero la declaración pública describe un promedio en una combinación no revelada de solicitudes. Es más honesto retener el contexto y la incertidumbre que convertirlos en una constante universal.

Cómo Treechat estima un mensaje

Treechat No se puede leer un medidor de potencia adjunto a cada respuesta. Los proveedores no exponen esa medida. En su lugar, estimamos y etiquetamos el resultado como una estimación.

Nuestro cálculo comienza con el modelo utilizado y los tokens procesados ​​y generados. Aplica una metodología energética basada en modelos públicos, agrega gastos generales al centro de datos y convierte la electricidad en emisiones estimadas utilizando una intensidad promedio de carbono de la red. Los supuestos y las constantes actuales se establecen en nuestra página de metodología.

Enrutamos las solicitudes diarias a un modelo más pequeño de forma predeterminada porque la elección del modelo es una palanca que realmente podemos accionar. También mostramos un recibo estimado en la respuesta en lugar de reclamar una medida exacta. Cuando la evidencia es incompleta, nos enfrentamos a nosotros mismos. Preferiríamos subestimar un ahorro que hacer una clara promesa que los datos subyacentes no pueden respaldar.

La respuesta más defendible, entonces, no es “una ChatGPT La consulta usa exactamente X". Lo es: las consultas de texto ordinarias parecen ocupar alrededor de una fracción de vatio-hora según estimaciones públicas recientes, mientras que el contexto prolongado, el razonamiento y el trabajo con muchas herramientas pueden usar mucho más. Pregunte qué modelo, cuántos tokens, qué hardware y qué límite. Sin esos detalles, el número es una señal, no un hecho sobre cada consulta.