Treechat
Menú
Probar gratis
Todas las notas

¿Por qué la IA utiliza tanta energía?

La IA convierte indicaciones en miles de millones de cálculos, mueve datos de modelos a través de la memoria y se ejecuta dentro de centros de datos que consumen mucha energía. Aquí es donde va la energía.

Por Treechat6 min de lectura
Las operaciones repetidas de la matriz, el movimiento de la memoria y los sistemas de refrigeración extraen energía de la red.

La IA utiliza una cantidad sustancial de energía porque producir una respuesta requiere muchas operaciones numéricas en chips especializados, moviendo repetidamente datos del modelo a través de la memoria y luego respaldando ese hardware con redes, conversión de energía y enfriamiento. Los modelos grandes, las indicaciones largas y los resultados extensos generalmente requieren más trabajo. La formación añade un coste energético separado y concentrado; atender millones de solicitudes posteriores agrega una continua.

No todas las tareas de IA son grandes. Un modelo de texto pequeño que responde a una pregunta breve puede utilizar una fracción de vatio-hora según estimaciones recientes. La preocupación es la combinación de modelos exigentes, uso creciente e instalaciones construidas con densidades de potencia inusuales. La Agencia Internacional de Energía dice que los servidores acelerados, impulsados ​​principalmente por la adopción de IA, son una fuente importante del crecimiento proyectado de la electricidad en los centros de datos en su Análisis de energía e inteligencia artificial.

Una respuesta es una cadena de cálculos.

Los modelos de lenguaje almacenan relaciones numéricas aprendidas en parámetros. Cuando llega un mensaje, los procesadores combinan la entrada con esos parámetros mediante grandes operaciones matriciales. Luego, el modelo predice un token, lo agrega al contexto y repite el proceso para el siguiente token.

Ese bucle token por token es la razón por la que la longitud de salida es importante. Pedir una respuesta concisa y pedir un libro no es el mismo trabajo. Las aportaciones también son importantes: una conversación larga o un documento cargado deben procesarse antes y durante la generación. Algunos sistemas de razonamiento también producen señales internas que el usuario nunca ve.

La electricidad exacta depende de algo más que el recuento de parámetros. La arquitectura del modelo, la precisión numérica, el acceso a la memoria, los núcleos de software y la generación del acelerador afectan la cantidad de trabajo útil que se entrega por vatio.

El chip no “conoce” simplemente el modelo sin trabajo físico. Los parámetros y valores intermedios tienen que moverse entre la memoria de gran ancho de banda y los procesadores. La capacidad de la memoria y el ancho de banda pueden convertirse en limitaciones, especialmente para los modelos grandes. Mantener el hardware alimentado con datos cuesta energía incluso cuando la aritmética en sí está altamente optimizada.

Esto ayuda a explicar por qué un modelo más pequeño o comprimido puede ser eficiente. Si es necesario leer menos pesos y realizar menos operaciones para cada token, la carga de trabajo puede disminuir. Los modelos de combinación de expertos también pueden activar solo una parte de sus parámetros totales para un token, aunque el diseño de enrutamiento y entrega sigue siendo importante.

La cuestión práctica se aborda en ¿Los modelos pequeños de IA consumen menos energía?. El tamaño es una señal importante, pero no es una medida de potencia completa.

El hardware de IA tiene mucha potencia

Los aceleradores modernos están diseñados para realizar enormes cantidades de operaciones en paralelo. Un rack lleno de ellos puede consumir mucha más energía que un rack de servidores convencionales. La capacitación y el servicio también conectan muchos chips a través de redes rápidas, que agregan su propia demanda de electricidad.

La AIE señala que los centros de datos centrados en la IA pueden tener cargas muy grandes y concentradas geográficamente. Esto crea un problema de planificación diferente al de la misma cantidad de consumo repartido por todo un país. Las conexiones a la red, las subestaciones y la generación deben estar disponibles en el lugar y en el momento adecuados.

EPRI Impulsando escenarios de inteligencia reflejan la incertidumbre: la demanda futura de centros de datos en EE. UU. cambia ampliamente dependiendo de los supuestos de desarrollo y uso. Por lo tanto, es mejor leer los pronósticos de electricidad como caminos condicionales, no como promesas.

El edificio alrededor de los chips también consume energía.

Los servidores son sólo una parte de un centro de datos. El enfriamiento elimina el calor. Las bombas y ventiladores mueven aire o líquido. Los sistemas de energía convierten la electricidad y brindan respaldo. El almacenamiento, los procesadores convencionales y los equipos de red coordinan la carga de trabajo.

Los analistas suelen resumir estos gastos generales con la eficacia del uso de energía, o PUE: electricidad total de la instalación dividida por la electricidad utilizada por los equipos de TI. Un PUE de 1 significaría que no hay gastos generales, algo que las instalaciones reales no pueden lograr. Un PUE más bajo es mejor, pero no indica qué tan eficiente es el modelo de IA en sí.

Este límite es importante al comparar El coste energético de un mensaje de IA.. Una estimación basada únicamente en el chip y una estimación a nivel de instalación pueden diferir incluso si ambos cálculos son internamente sólidos.

La formación es amplia; la inferencia es implacable

El entrenamiento expone un modelo a enormes conjuntos de datos y actualiza sus parámetros en muchos procesadores. Puede funcionar durante días o más, y los experimentos y las ejecuciones de entrenamiento descartadas agregan trabajo más allá de la ejecución final exitosa. Los totales públicos son raros, y comparar las cifras de capacitación de los titulares es difícil cuando el hardware, la ubicación y los límites contables difieren.

La inferencia es menor por tarea, pero ocurre cada vez que alguien pregunta. Un modelo muy utilizado puede eventualmente consumir más a través de la inferencia que del entrenamiento; un modelo ligeramente usado puede que no. Las funciones que realizan múltiples llamadas (búsqueda, agentes, análisis de imágenes o autoverificación repetida) pueden convertir una acción visible en varios trabajos de backend.

Ésta es la razón por la que “una indicación” no es una unidad técnica duradera. Lo que hace el servicio después del mensaje es al menos tan importante como las palabras escritas antes.

Una IA más eficiente aún puede significar más electricidad

La eficiencia de la IA está mejorando gracias a mejores chips, cuantificación, escasez, procesamiento por lotes y diseño de modelos. Luccioni, Jernite y Strubell comparación de cargas de trabajo de inferencia También muestra que la elección de tareas y modelos importa: los sistemas generativos de propósito general pueden requerir sustancialmente más energía que los modelos de tareas específicas para las tareas evaluadas.

Sin embargo, una respuesta más barata puede generar más respuestas. La IA se está agregando a la búsqueda, el software de oficina, la codificación, la atención al cliente y la generación de medios. La demanda total aumenta si el número de tareas crece más rápido de lo que disminuye la energía por tarea. Así es como la mejora de la eficiencia y el aumento del uso de electricidad pueden ser ambos realidad.

El caso base de la AIE proyecta que el consumo mundial de electricidad de los centros de datos aumentará de aproximadamente 415 TWh en 2024 a aproximadamente 945 TWh en 2030. Atribuye el crecimiento a la IA, así como a otros servicios digitales, por lo que el total no debería reetiquetarse solo como IA.

Qué usuarios y servicios pueden cambiar

A nivel de servicio, las palancas principales son elegir el modelo más pequeño capaz, mejorar la utilización, limitar las llamadas innecesarias a herramientas, utilizar hardware eficiente y ubicar trabajos flexibles donde haya electricidad con bajas emisiones de carbono disponible. A nivel de usuario, indicaciones concisas, límites de salida sensatos y el uso de software común cuando hace el trabajo pueden evitar cálculos innecesarios.

Treechat dirige las preguntas cotidianas a un modelo más pequeño y estima la energía de cada respuesta a partir del uso del modelo y del token. El recibo incluye una provisión declarada para gastos generales del centro de datos; sigue siendo una estimación porque los proveedores no exponen un medidor para cada respuesta. Nuestro metodología enumera los supuestos actuales.

La IA utiliza energía por razones físicas comprensibles, no porque las indicaciones se conviertan misteriosamente en contaminación. La respuesta útil es hacer visible el trabajo computacional, reducirlo cuando sea posible y reservar sistemas más grandes para trabajos que realmente los necesitan.