Treechat
Meniu
Încearcă gratuit
Toate articolele

Amestecul de experți, explicat simplu

Un model de amestec de experți direcționează fiecare jeton prin blocuri specializate selectate, activând doar o parte a unei rețele mari, dar povestea eficienței are avertismente.

De Treechat6 min de citit
Un router trimite fiecare panglică token doar la câteva ateliere specializate în procesoare.

Un model de amestec de experți, sau MoE, conține mai multe blocuri de rețea neuronală de specialitate și un router care alege care dintre ele gestionează fiecare token. În loc să activeze fiecare parametru pentru fiecare pas, folosește doar un subset selectat. Acest lucru permite unui model să aibă o capacitate totală mare fără a plăti costul aritmetic complet al unui model dens de aceeași dimensiune totală pentru fiecare jeton.

MoE nu înseamnă „multe AI complete care dezbat un răspuns” și nu eliberează calculul. Experții trebuie încă stocați în memorie, rutarea necesită muncă, iar mutarea jetoanelor între cipuri poate adăuga costuri de comunicare. Parametrii activi, aspectul hardware, utilizarea și lungimea ieșirii contează mai mult decât totalul titlului.

Gândiți-vă la un atelier cu aport comun

Imaginați-vă un atelier cu mai multe bănci de specialitate. Fiecare articol intră prin aceeași recepție. Un dispecer îl examinează și îl trimite la una sau două bănci considerate cele mai utile. Întregul atelier deține multe unelte, dar pentru acel articol este folosit doar un set mic.

Într-un MoE transformator, părțile partajate ale rețelei încă procesează fiecare jeton. La anumite straturi, un router punctează experții disponibili și selectează câțiva. Acești experți sunt de obicei blocuri de tip feed-forward, mai degrabă decât modele complete cu profesii care pot fi citite de om. Un expert nu este sigur „expertul în poezie” și altul „expertul în matematică”, chiar dacă specializarea apare în timpul formării.

Ieșirile selectate sunt combinate și procesarea continuă. Decizia se întâmplă în mod repetat, adesea pentru fiecare jeton și la mai multe straturi, astfel încât cuvintele adiacente pot lua rute diferite.

Opțiunile routerului sunt mai degrabă numerice decât o predare conștientă. Experții învață prin formare, iar rolurile lor se pot suprapune sau pot fi dificil de interpretat de către oameni.

Modelele dense și rare cheltuiesc capacitatea diferit

Un model de limbaj dens folosește în mare același set de parametri pentru fiecare token. Creșterea numărului de parametri crește, în general, traficul de calcul și memorie necesar la fiecare pas de generare. Un MoE rar poate crește parametrii totali menținând în același timp subsetul activ relativ stabil.

The Comutator de hârtie pentru transformator a simplificat această idee prin direcționarea fiecărui token către un expert la straturile sale MoE. Experimentele sale au raportat pre-antrenament mai rapid decât modelele de comparație dense în condițiile autorilor. Aceste rezultate demonstrează potențialul arhitecturii; nu sunt un raport de energie universal pentru produsele de chat actuale.

Această distincție explică de ce numărul total de parametri poate induce în eroare. Un MoE anunțat ca fiind foarte mare poate efectua aritmetică cu mult mai puțini parametri per token. Dar experții inactivi încă ocupă memoria acceleratorului și ar putea fi necesar să fie răspândiți pe mașini.

Cifrele parametrilor activi au nevoie și de context. Atenția comună și straturile de încorporare încă rulează, astfel încât ponderile de experți selectate nu reprezintă neapărat întreaga sarcină de lucru activă a modelului.

Routerul trebuie să țină experții ocupați

Dacă routerul trimite cele mai multe jetoane aceluiași expert, acel expert devine o coadă, în timp ce alții stau inactiv. Prin urmare, instruirea utilizează mecanisme de echilibrare care încurajează răspândirea traficului între experți. Sistemele stabilesc, de asemenea, limite de capacitate pentru câte jetoane acceptă un expert într-un lot.

Rutarea poate fi instabilă la începutul antrenamentului. Experții pot învăța funcții similare sau unii pot primi prea puține date. Inginerii reglează pierderile auxiliare, capacitatea, zgomotul și plasarea pentru a îmbunătăți echilibrul fără a afecta calitatea modelului.

Servirea adaugă o problemă fizică: experții selectați pot trăi cu acceleratoare diferite. Tokenurile călătoresc apoi printr-o rețea de mare viteză între straturi partajate și blocuri de experți. Comunicarea poate limita viteza și poate crește energia, în special cu loturi mici sau plasare proastă. Aritmetica rară este doar o parte a mașinii.

Limitele de capacitate creează un alt compromis. Eliminarea, întârzierea sau redirecționarea token-urilor în exces poate proteja debitul, dar implementarea trebuie să păstreze calitatea răspunsului în condiții de trafic real inegal.

De ce MoE poate fi eficient

MoE oferă mai multă capacitate de reprezentare fără a activa întreaga rețea de fiecare dată. Pentru o calitate țintă, aceasta poate reduce formarea sau calculul inferenței în raport cu un model dens la fel de capabil. De asemenea, poate permite diferiților experți să învețe modele utile din diferite limbi sau domenii.

Eficiența depinde de implementare. Loturi mari pot menține experții ocupați și pot face comunicarea să merite. Cuantizarea poate reduce traficul de memorie. Rutarea bună și topologia hardware reduc congestia. Un model servit la utilizare scăzută poate să nu realizeze aceste câștiguri.

Cel mai important, un calcul mai mic per token nu garantează o energie mai mică pentru fiecare sarcină finalizată. Ieșirile mai lungi, reîncercările, ferestrele de context mari și instrumentele de agenți pot depăși economiile arhitecturale. Cum să vă reduceți amprenta de carbon AI se concentrează pe întregul loc de muncă, mai degrabă decât pe o proprietate atractivă a modelului.

Prin urmare, măsurătorile operaționale sunt preferabile unei estimări pe hârtie, atunci când sunt disponibile. Puterea, latența și succesul ar trebui comparate pe același hardware, condiții de lot și solicitări reprezentative.

De ce MoE nu este același lucru cu un model mic

A model de limbaj mic are mai puțini parametri totali și se potrivește adesea pe hardware modest. Un ME poate conține o colecție foarte mare de experți, dar activează doar câțiva. Aritmetica sa pentru un jeton poate părea mai mică decât dimensiunea totală, dar stocarea și implementarea acestuia pot rămâne substanțiale.

Acest lucru contează pentru estimările de mediu. Un calcul bazat numai pe parametrii totali poate supraestima calculul activ. Unul bazat doar pe parametrii activi poate omite memoria, rețea, capacitatea inactivă și infrastructura de suport. Nici unul dintre numere nu este o măsurătoare a puterii instalației.

Când comparați modele, solicitați parametrii totali, parametrii activi pe token, precizia numerică, contextul tipic și lungimea de ieșire și hardware-ul utilizat. Apoi testați calitatea și energia pentru aceeași sarcină completă.

Pentru implementarea locală, memoria totală poate fi constrângerea obligatorie chiar și atunci când calculul activ pare gestionabil. Un model compact dens poate fi opțiunea mai practică pe hardware limitat.

Ce se schimbă MoE pentru utilizatori

De obicei, utilizatorii nu pot controla rutarea în interiorul unui model găzduit. Ei pot controla cererea în jurul acesteia: oferă context relevant, solicită rezultate proporționale și evită regenerările inutile. Furnizorii de modele controlează plasarea experților, loturile, capacitatea și eficiența hardware-ului.

Un model MoE poate fi o alegere bună pentru un serviciu larg, deoarece combină capacitatea cu activarea redusă. Poate fi încă excesiv pentru o simplă extracție pe care o poate gestiona un model compact dens. AI verde înseamnă să alegeți între arhitecturi bazate pe valoarea livrată și resursele măsurate, fără a presupune întotdeauna câștiguri rare.

Treechat Chitanța lui estimează energia operațională folosind modelul selectat și numărul de simboluri, apoi adaugă cheltuielile generale ale centrului de date. Deoarece furnizorii nu expun rutarea experților în direct sau puterea per răspuns, aceasta rămâne o aproximare bazată pe model. Ipotezele și excluderile sunt publicate la /methodology.

Rezumatul simplu este că amestecul de experți separă cât de mult știe un model de cât de mult funcționează simultan. Acest lucru poate face ca capacitatea mare să fie mai eficientă din punct de vedere computațional, dar memoria, comunicarea și comportamentul real al sarcinii de lucru determină dacă promisiunea devine o economie reală.

Amestecul de experți, explicat simplu · Treechat blog