Treechat
Menú
Probar gratis
Todas las notas

Entrenamiento de IA versus emisiones de inferencia

El entrenamiento crea el modelo en una explosión concentrada; la inferencia le sirve repetidamente. Cuál emite más depende principalmente del uso de por vida y de la electricidad.

Por Treechat6 min de lectura
Una gran forja de entrenamiento de modelos da paso a muchas estaciones de trabajo de inferencia más pequeñas.

Las emisiones del entrenamiento de IA provienen de la computación concentrada utilizada para crear o actualizar sustancialmente un modelo. Las emisiones de inferencia provienen de operar ese modelo cada vez que alguien solicita una respuesta, predicción o imagen. La formación puede ser una tarea muy grande y puntual; La inferencia es menor por tarea, pero se repite a lo largo de la vida implementada del modelo.

Tampoco lo es siempre la proporción mayor. Un modelo popular que atiende a un tráfico enorme puede acumular más emisiones de inferencia que el entrenamiento. Un modelo costoso que apenas se utiliza puede seguir dominado por la capacitación. El resultado también depende de la eficiencia del hardware, la duración de las tareas, los gastos generales del centro de datos y la intensidad de carbono de la electricidad. Cualquier afirmación universal como “la capacitación representa el 90% de las emisiones de IA” debe tratarse con cautela a menos que se adjunte su modelo, período de tiempo y límite contable.

¿Qué sucede durante el entrenamiento?

La capacitación alimenta datos a través de un modelo, compara sus resultados con un objetivo de aprendizaje y actualiza los parámetros. Ese ciclo se repite en muchos lotes de grupos de aceleradores. Las tiradas grandes también utilizan redes, almacenamiento y refrigeración de alta velocidad.

La ejecución final de la capacitación no es necesariamente la huella de desarrollo completa. Los equipos prueban arquitecturas, ajustan la configuración, preparan datos y, en ocasiones, abandonan las ejecuciones. Los ajustes finos y las actualizaciones posteriores del modelo añaden más cálculos. Los informes públicos pueden incluir sólo la ejecución exitosa, un programa de investigación más amplio o nada específico del modelo.

El carbono depende entonces de dónde y cuándo se produce este trabajo. Una carrera de entrenamiento medida en megavatios-hora no se puede convertir en emisiones sin una suposición de suministro de electricidad.

¿Qué sucede durante la inferencia?

La inferencia utiliza los parámetros entrenados sin actualizarlos. Para un modelo de lenguaje, el servicio procesa el mensaje y predice los tokens de salida uno por uno. Un contexto y un resultado más extensos generalmente requieren más trabajo. Las funciones de razonamiento, búsqueda y agente pueden activar tokens ocultos o varias llamadas.

Servir también tiene complicaciones operativas. El hardware puede esperar tráfico, las solicitudes pueden agruparse y los modelos pueden dividirse entre aceleradores. Un servidor muy utilizado puede distribuir una sobrecarga fija en más respuestas que uno poco utilizado. La refrigeración, las redes y la conversión de energía aumentan la demanda de las instalaciones.

Luccioni, Jernite y Strubell comparación de inferencia encontró una variación sustancial entre tareas y tipos de modelos, lo que refuerza que "una inferencia" no es una unidad de energía estándar.

El uso de por vida decide el equilibrio.

Imagine el entrenamiento como un equilibrio inicial y la inferencia como un medidor que aumenta con cada uso. El punto en el que la inferencia supera al entrenamiento depende de la huella de entrenamiento inicial dividida por la energía operativa por solicitud. Ambas cifras son inciertas y el volumen de solicitudes de por vida es desconocido en el momento del lanzamiento.

Esto hace que la asignación de capacitación por mensaje sea frágil. Divida por el tráfico de por vida previsto y la huella asignada cambia cuando la adopción difiere del pronóstico o el modelo se retira anticipadamente. Puede ser útil para el análisis de escenarios, pero no debe describirse como electricidad consumida cuando un usuario en particular presionó enviar.

nuestra guía para ¿Cuánto CO2 produce la IA? mantiene esta vista del ciclo de vida asignada separada de una estimación de respuesta operativa.

La destilación entrena un modelo más pequeño para reproducir un comportamiento útil a partir de uno más grande. Eso agrega cálculos de desarrollo, pero puede reducir la energía en muchas inferencias futuras. La cuantificación o poda también puede requerir preparación y, al mismo tiempo, reducir los costos de servicio. Que el comercio rinda frutos depende de la escala.

Por el contrario, entrenar un modelo general altamente capaz puede evitar entrenar muchos modelos limitados, pero servirlo para tareas simples puede ser un desperdicio. Dirigir solicitudes comunes a un modelo más pequeño y reservar el sistema grande para trabajos difíciles puede reducir la demanda continua.

¿Los modelos pequeños de IA consumen menos energía? examina por qué la respuesta es generalmente sí para tareas comparables, mientras que la capacidad y los reintentos aún pertenecen al total.

La contabilidad del carbono cambia ambas partes

Dos carreras de entrenamiento con la misma energía pueden tener diferentes emisiones en diferentes redes. La inferencia puede distribuirse geográficamente, por lo que su intensidad de carbono puede variar según las regiones y las horas. Los contratos de energía renovable pueden cambiar los informes de las empresas basados ​​en el mercado sin cambiar la combinación de la red física en cada momento.

Las emisiones incorporadas complican aún más la división. ¿Debería asignarse la fabricación de un grupo de capacitación a la capacitación, incluso si el hardware luego sirve para inferencias? ¿Cómo debería asignarse un edificio de centro de datos compartido entre la IA y las cargas de trabajo convencionales? No hay una respuesta libre de contexto.

El Huella de carbono de la IA es por lo tanto más amplio que el entrenamiento más la electricidad de inferencia. Los chips, los edificios y las cadenas de suministro deben aparecer en alguna parte de una evaluación del ciclo de vida completo.

Por qué los pronósticos del sistema rara vez los separan claramente

Los planificadores de redes ven la demanda de instalaciones. Un centro de datos puede entrenar un modelo mientras atiende a varios otros y ejecuta cargas de trabajo en la nube que no son de IA. Los anuncios públicos de capacidad no siempre revelan la utilización o la combinación de cargas de trabajo.

La Agencia Internacional de Energía estima que los centros de datos globales utilizaron aproximadamente 415 TWh en 2024 y proyecta alrededor de 945 TWh en 2030 en su caso base. Identifica los servidores acelerados, impulsados ​​principalmente por IA, como una importante fuente de crecimiento. Esas cifras contienen capacitación, inferencia y servicios no relacionados con la IA en lugar de una división clara.

Esta visión combinada es adecuada para la planificación eléctrica. No puede decirle a un usuario qué parte de una respuesta pertenece a una ejecución de entrenamiento anterior.

¿En qué emisiones debería centrarse?

Los desarrolladores de modelos deben revelar la energía de entrenamiento, la ubicación, el hardware y el alcance del desarrollo; mejorar la eficiencia de la formación; y evitar ejecuciones duplicadas innecesarias. Los operadores de servicios deben realizar un seguimiento de las inferencias, utilizar modelos de tamaño adecuado, aumentar la utilización, reducir los tokens innecesarios y obtener electricidad con bajas emisiones de carbono. Las emisiones del hardware y la construcción necesitan sus propios planes de reducción.

Los usuarios tienen más influencia sobre la inferencia: eligen un modelo adecuado, limitan la producción innecesaria y evitan generaciones repetidas. No pueden cambiar retroactivamente la ejecución de la capacitación, pero la demanda puede influir en qué sistemas implementan los proveedores.

Treechat El recibo por respuesta de estima la inferencia operativa en lugar de asignar capacitación histórica o emisiones incorporadas. Utiliza recuentos de modelos y tokens con suposiciones de red y centros de datos publicados. Ese límite más estrecho es explícito en nuestra página de metodología.

Entrenamiento versus inferencia no es una competencia con un ganador permanente. Informe por separado la fase inicial concentrada, la fase operativa de acumulación y el ciclo de vida más amplio. Entonces las decisiones pueden centrarse en las emisiones que realmente pueden cambiar.

Entrenamiento de IA versus emisiones de inferencia · Treechat blog