Treechat
Meniu
Încearcă gratuit
Toate articolele

Ce se întâmplă când trimiți un mesaj AI?

Urmăriți un mesaj AI de pe ecran prin tokenizare, rutare a modelului, inferență în centrul de date și ieșire transmisă în flux - și vedeți unde este folosită energia.

De Treechat6 min de citit
Un mesaj trece de la tastatură la token-uri, rutarea modelului, procesarea și răspunsul transmis în flux.

Când trimiteți un mesaj AI, serviciul îl transmite unui centru de date, formatează conversația, convertește textul în simboluri și direcționează cererea către un model. Modelul procesează intrarea, prezice un simbol de ieșire și repetă acea predicție până când răspunsul este complet. Serviciul transmite acele jetoane înapoi pe ecran.

Electricitatea este utilizată de-a lungul acestui lanț: echipamentele de rețea, procesoarele, memoria și acceleratoarele funcționează, în timp ce sistemele de răcire și alimentare susțin instalația. Un răspuns scurt text poate implica un apel model. Căutarea, fișierele încărcate, moduri de raționament, imagini sau agenți pot declanșa mai multe sisteme. De aceea, „un singur mesaj” nu este o unitate fixă ​​de energie, carbon sau apă.

Aplicația pregătește și trimite cererea

Dacă apăsați pe trimitere, se creează o solicitare de rețea care conține noul dvs. mesaj și orice context decide serviciul să includă. Aceasta poate fi conversația recentă, instrucțiunile de sistem, setările modelului și referințele la fișiere sau instrumente. Servicii bune criptează conexiunea, autentifică sesiunea și aplică verificări de dimensiune sau siguranță înainte de procesarea modelului.

Textul circulă prin rețelele locale, infrastructura de internet și serverele marginale ale furnizorului sau de aplicații. Pentru un chat normal, calculul centrului de date domină de obicei estimarea operațională, dar rețeaua nu este literalmente lipsită de impact. Alocarea exactă este dificilă deoarece infrastructura este partajată.

Intimitatea este separată de energie. Un asistent eficient poate avea în continuare termeni nepotriviți de reținere sau formare. Nu inserați informații sensibile personale, școlare sau companie decât dacă serviciul și politica dvs. permit acest lucru. Ghidul unui student pentru impactul AI asupra mediului acoperă această judecată mai largă pentru utilizarea în clasă.

Screeningul de securitate poate adăuga și procesare, deși furnizorii rareori o alocă răspunsurilor individuale.

Textul devine simboluri care pot fi citite de model

Modelele de limbaj nu primesc propoziții exact așa cum le văd oamenii. Un tokenizer mapează textul în bucăți numerotate numite jetoane. Un simbol poate fi un cuvânt, parte dintr-un cuvânt, punctuație sau un marcator de control special. Serviciul aplică, de asemenea, un șablon de chat care distinge rândurile de sistem, utilizator și asistent.

Fața îmbrățișată documentația tokenizerului arată cum mesajele de chat formatate devin ID-uri de intrare și măști de atenție pregătite pentru un model. Diferite modele pot semnifica aceeași propoziție în mod diferit, astfel încât numărul de cuvinte este doar un proxy aproximativ pentru intrarea computațională.

Istoricul lung de chat, documentele lipite și paginile web preluate adaugă simboluri. Furnizorii pot trunchia, rezuma sau stoca în cache un anumit context, dar comportamentul lor nu este întotdeauna public. Intrarea clară și relevantă reduce procesarea inutilă și poate îmbunătăți răspunsul în același timp. Este mai util decât să te obsedezi dacă un cuvânt politicos adaugă un simbol.

Un router alege ce rulează

Unele servicii trimit fiecare cerere către un singur model. Alții direcționează în funcție de complexitate, abonament, latență, limbă, politică de siguranță sau caracteristică solicitată. O întrebare simplă poate merge la un model mic; raționamentul dificil poate merge la unul mai amplu. Căutarea și analiza fișierelor pot adăuga sisteme de recuperare înainte de a începe generarea.

Asistenții care utilizează instrumente pot rula o buclă: întreabă modelul ce trebuie să facă, apelează căutarea sau codul, returnează rezultatul instrumentului la model și generează sau verifică un răspuns. Interfața poate prezenta întregul flux de lucru ca un singur mesaj, chiar dacă au avut loc mai multe joburi backend.

Această variație ascunsă face ca comparațiile doar pentru mărci să fie slabe. Alegerea unui asistent AI în funcție de consumul de energie recomandă să verificați dacă furnizorii dezvăluie rutarea modelului, instrumentele opționale și limita din jurul cifrelor lor. Fără aceste informații, o medie pe mesaj este mai degrabă un indicator decât o măsurătoare a solicitării dvs. particulare.

Decizia routerului poate conta mai mult decât câteva cuvinte în plus în prompt.

Modelul procesează promptul

Inferența începe cu o fază de pre-umplere. Modelul procesează jetoanele de intrare, efectuând operații matrice pe straturile sale și creând date de atenție intermediară care pot fi reutilizate în timpul generării. Un prompt mai lung crește în general această muncă inițială și memoria necesară pentru contextul său.

Arhitectura Transformer folosește atenția pentru a lega jetoanele într-o secvență, așa cum este introdus în lucrarea de cercetare Atenția este tot ce aveți nevoie. Modelele moderne de chat adaugă multe rafinamente de inginerie, dar operațiunile numerice mari și mișcarea datelor modelului prin memorie rămân centrale.

Acceleratoarele precum GPU-urile sau TPU-urile efectuează aceste operațiuni în paralel. Procesoarele gazdă, RAM și interconexiunile de mare viteză coordonează volumul de lucru. Furnizorii pot grupa mai mulți utilizatori împreună pentru a îmbunătăți utilizarea. Acest lucru poate reduce energia pe răspuns, deși poate adăuga timp de așteptare și face ca calculele simple ale „puterii cipului înmulțite cu secunde” să fie incomplete.

Nucleele software și precizia numerică afectează, de asemenea, cât de multă muncă utilă completează același hardware.

Răspunsul este generat și transmis în flux

După completare preliminară, modelul produce rezultate autoregresiv: calculează probabilitățile pentru următorul token, selectează unul conform regulilor sale de decodare, îl adaugă la context și îl repetă. Google cercetătorii descriu în mod clar constrângerea de bază: generarea mai multor jetoane de ieșire necesită în mod normal rulări de modele în serie, chiar dacă tehnici precum decodificarea speculativă pot accelera procesul.

Acesta este motivul pentru care lungimea de ieșire contează. „Dă-mi trei gloanțe” și „scrie un raport detaliat” solicită cantități diferite de generare. Sistemele de raționament pot crea, de asemenea, jetoane interne care nu sunt afișate, în timp ce generarea de imagini și video utilizează din nou procese diferite.

Serverul poate trimite fiecare piesă finalizată înapoi așa cum apare, creând efectul de tastare. Streamingul face ca interfața să se simtă rapidă, dar nu înseamnă că răspunsul complet a fost calculat în avans. Generarea se oprește atunci când modelul emite un marker de capăt, atinge o limită, un instrument o întrerupe sau utilizatorul o anulează.

Facilitatea suportă calculul

Serverele transformă electricitatea în calcul și căldură. Ventilatoarele, pompele, răcitoarele sau turnurile de răcire elimină această căldură. Conversia energiei, sursele neîntreruptibile, rețelele și iluminatul adaugă suprafața instalației. Eficacitatea consumului de energie exprimă energia totală a centrului de date împărțită la energia IT, dar nu măsoară calitatea modelului, carbonul sau apa.

Carbonul operațional depinde de energia electrică care furnizează site-ul. Apa poate fi consumată direct prin răcire și indirect prin generarea de energie. Fabricarea feroneriei și construcția clădirilor adaugă impact în afara majorității estimărilor pe mesaj. O alocare completă a ciclului de viață este mult mai dificilă decât estimarea inferenței operaționale.

Răspunsul poate fi, de asemenea, înregistrat, stocat în cache sau stocat în istoricul de chat în funcție de setările serviciului. Aceste acțiuni folosesc infrastructura, dar furnizorii rareori expun suficiente informații pentru a le atribui exact unui singur răspuns. Contabilitatea sinceră afirmă ceea ce exclude în loc să ascundă incertitudinea în spatele zecimalelor.

Prin urmare, setările de păstrare pot conta pentru confidențialitate chiar și atunci când efectul lor energetic nu poate fi izolat.

Ce poate și nu poate spune chitanța de mesaj

O chitanță utilă poate înregistra modelul, jetoanele de intrare și de ieșire și dacă a fost utilizat un sistem mai mare. Apoi poate aplica o estimare a energiei și o taxă generală dezvăluită pentru centrul de date. Acest lucru creează o comparație consistentă în cadrul serviciului, chiar și atunci când nu este atașat un contor de putere la răspunsul individual.

Treechat urmează această abordare. Ei metodologie descrie o estimare operațională bazată pe model folosind informații despre model și simbol, PUE declarat și un factor mediu de carbon al rețelei. Rezultatul apei este derivat din energia estimată. Nu este o citire a instalației și nu include fiecare impact pe ciclul de viață.

Pentru întrebări mai frecvente despre aceste limite, consultați Întrebări frecvente privind impactul asupra mediului AI. Lecția practică este simplă: un clic poate începe un lanț de lucru. Utilizați cel mai simplu instrument și cel mai mic model capabil, păstrați contextul relevant, solicitați rezultatul de care aveți nevoie și tratați orice cifră per mesaj ca o estimare cu o limită numită.