El coste energético de un mensaje de IA
Un mensaje de texto ordinario de IA probablemente utilice una fracción de vatio-hora, pero el modelo, los tokens, las herramientas y los límites contables amplían el rango.

Para un intercambio de texto normal, las mejores estimaciones públicas recientes sugieren un costo de energía de aproximadamente una fracción de vatio-hora, no una cantidad fija para cada mensaje de IA. OpenAI El director ejecutivo Sam Altman ha declarado un promedio ChatGPT usos de consulta sobre 0.34 vatios-hora, mientras que Epoch AI estimó de forma independiente alrededor de 0.3 Wh para un típico GPT-4o consulta.
Esas cifras son puntos de referencia útiles, no medidas directas de su mensaje. Una reescritura de dos líneas, un análisis de un documento largo y una tarea de investigación que utiliza herramientas pueden parecer una sola acción de envío y, al mismo tiempo, requieren cantidades muy diferentes de computación. El modelo, la longitud de entrada, la longitud de salida, el razonamiento oculto, el hardware y los gastos generales del centro de datos afectan el total.
“Un mensaje” oculta varias unidades
Un mensaje tiene una entrada: su nuevo mensaje, instrucciones del sistema y, a menudo, una conversación anterior. También tiene una salida, generada un token a la vez. Los insumos más largos necesitan más procesamiento; Las salidas más largas mantienen el modelo funcionando durante más pasos de generación.
El mensaje visible puede desencadenar más de una llamada de modelo. La investigación web puede buscar, recuperar páginas, sintetizarlas y comprobar el resultado. Un agente podría escribir código, inspeccionar un error y volver a intentarlo. La creación de imágenes utiliza un proceso computacional diferente al del texto. Un promedio de servicio combina una combinación de estos trabajos, mientras que una estimación elaborada generalmente describe uno en particular.
Antes de utilizar una cifra por mensaje, pregunte qué tipo de mensaje representa. Sin esa definición, la unidad es conveniente pero débil.
De dónde proviene la estimación de fracción de vatio-hora
La cifra de 0.34 Wh de Altman es una declaración de la empresa sin un cálculo publicado. La cifra de aproximadamente 0.3 Wh de Epoch es una estimación modelada con suposiciones sobre GPT-4o, hardware, utilización y una cantidad típica de tokens. El acuerdo entre ellos es tranquilizador, pero no es lo mismo que el acceso independiente a OpenAI Los medidores de potencia.
Epoch también modeló cómo un contexto más prolongado cambia el resultado. Sus ejemplos aumentan notablemente para entradas de decenas de miles de tokens. Eso no hace que esos ejemplos sean típicos; demuestra por qué falla una constante universal.
Nuestra revisión más profunda de ¿cuánta energía un ChatGPT usos de consulta explica los supuestos y por qué no se debe utilizar texto ordinario como sustituto de todas las funciones de IA.
Por qué la antigua estimación de 3 Wh es un mal valor predeterminado
Durante años, los artículos repitieron una estimación de aproximadamente 3 Wh por ChatGPT consulta. Provino de suposiciones que involucraban hardware más antiguo, un GPT-3.5-scale Modelo y una producción muy larga. Época comparación con estimaciones anteriores Sostiene que estas entradas no representan una conversación moderna típica.
La lección no es que todos los trabajos anteriores fueran una tontería. Las estimaciones deben elegir un modelo, una generación de hardware y una forma de solicitud, y esos datos envejecen rápidamente. El error viene cuando un escenario se convierte en un hecho eterno.
El error inverso es tratar el promedio bajo más reciente como prueba de que todo el uso de IA es insignificante. La demanda total también depende de la cantidad de mensajes y de la llegada de funciones más intensivas.
Un vatio-hora mide la energía. No te dice qué central eléctrica lo suministró ni las emisiones asociadas a la generación. Convertir electricidad en carbono requiere una suposición de intensidad de carbono de la red vinculada a una ubicación e, idealmente, a un tiempo. Los contratos de energía renovable de las empresas añaden otra capa contable.
El agua vuelve a ser diferente. Algunas instalaciones utilizan agua directamente para refrigeración, mientras que la generación de electricidad puede tener una huella hídrica indirecta. El diseño de refrigeración, el clima y la red combinan todo. Es engañoso asociar una cantidad universal de agua a cada mensaje de IA por la misma razón por la que falla un número universal de energía.
Huella de carbono de la IA explicada separa la electricidad operativa de las emisiones incorporadas en chips y edificios, que normalmente están fuera de una estimación de inferencia por mensaje.
Los modelos más pequeños pueden cambiar el costo.
Para el mismo recuento de tokens y condiciones de servicio comparables, un modelo más pequeño generalmente realiza menos cálculos que un modelo denso grande. La cuantificación, las arquitecturas mixtas de expertos y los chips más nuevos pueden reducir aún más el trabajo. El procesamiento por lotes eficiente puede compartir la infraestructura entre varias solicitudes.
Pero los resultados útiles son importantes. Si un modelo pequeño falla y el usuario repite el mensaje cuatro veces antes de cambiar a uno más grande, es posible que la elección nominalmente eficiente no minimice toda la tarea. Un modelo estrecho y especializado puede ser más pequeño y mejor para la función prevista; una tarea de razonamiento difícil puede justificar un sistema más grande.
Esta es la razón uso de energía de modelo pequeño debe considerarse junto con la adecuación a la tarea, no utilizarse como regla de que la opción más pequeña siempre gana.
Lo que normalmente se deja fuera
La mayoría de las estimaciones de mensajes cubren la electricidad de inferencia y, a veces, los gastos generales del centro de datos. Por lo general, omiten la capacitación, los experimentos de desarrollo de modelos, la fabricación de chips, la construcción de centros de datos, los equipos de red fuera de las instalaciones y el dispositivo del usuario. También pueden omitir la capacidad ociosa que se mantiene preparada para los picos de demanda.
No existe un límite obligatorio único para cada pregunta. La energía operativa es apropiada cuando se comparan dos formas de dar una respuesta. El impacto del ciclo de vida es más apropiado cuando se evalúa una empresa o modelo a lo largo del tiempo. Lo que importa es nombrar el límite y no presentar una estimación limitada como una huella completa.
A escala del sistema, la AIE perspectivas de electricidad del centro de datos incluye demanda de infraestructura y proyecta un fuerte crecimiento, siendo la IA un importante impulsor. No proporciona una conversión de mensajes universal.
como Treechat calcula su recibo
Treechat estima en lugar de medir cada respuesta. El cálculo utiliza el modelo seleccionado, los recuentos de tokens de entrada y salida y luego agrega un factor de gastos generales del centro de datos publicado. Convierte esa energía en emisiones estimadas con un supuesto promedio de red establecido. Las constantes, el método de redondeo y las omisiones conocidas se encuentran en nuestra página de metodología.
Ese recibo se lee mejor de forma comparativa: una respuesta más corta de un modelo más pequeño normalmente debería mostrar menos energía operativa estimada que una respuesta larga de uno más grande. No es lo suficientemente preciso como para certificar el impacto del ciclo de vida completo de ninguno de los dos.
Por lo tanto, según estimaciones públicas recientes, el costo de energía de un mensaje de texto ordinario de IA es plausiblemente de alrededor de una fracción de vatio-hora. Para un mensaje específico, la respuesta honesta es un rango modelado formado por lo que realmente hizo el sistema después de presionar enviar.