Treechat
Menu
Wypróbuj za darmo
Wszystkie wpisy

Mieszanka ekspertów, wyjaśniona w prosty sposób

Model złożony z ekspertów kieruje każdy token przez wybrane specjalistyczne bloki, aktywując tylko część dużej sieci, ale historia wydajności ma pewne zastrzeżenia.

Autor Treechat5 min czytania
Router wysyła każdą wstążkę tokena tylko do kilku specjalistycznych warsztatów zajmujących się procesorami.

Model złożony z ekspertów, czyli MoE, zawiera kilka specjalistycznych bloków sieci neuronowych i router, który wybiera, które z nich obsługują każdy token. Zamiast aktywować każdy parametr w każdym kroku, wykorzystuje tylko wybrany podzbiór. Dzięki temu model może mieć dużą całkowitą pojemność bez płacenia pełnego kosztu arytmetycznego gęstego modelu o tym samym całkowitym rozmiarze na każdym żetonie.

Ministerstwo Środowiska nie oznacza „wielu kompletnych sztucznej inteligencji debatujących nad odpowiedzią” i nie zwalnia z obliczeń. Eksperci muszą być nadal przechowywani w pamięci, routing wymaga pracy, a przenoszenie tokenów między chipami może zwiększać koszty komunikacji. Aktywne parametry, układ sprzętu, wykorzystanie i długość wyjściowa mają większe znaczenie niż sam nagłówek.

Pomyśl o warsztatach ze wspólnym spożyciem

Wyobraźmy sobie warsztat z kilkoma specjalistycznymi stołami. Każdy przedmiot wchodzi przez tę samą recepcję. Dyspozytor sprawdza go i przesyła do jednego lub dwóch stanowisk, które uzna za najbardziej przydatne. Cały warsztat posiada wiele narzędzi, ale do tego przedmiotu używany jest tylko niewielki zestaw.

W transformatorowym MoE współdzielone części sieci nadal przetwarzają każdy token. Na niektórych warstwach router ocenia dostępnych ekspertów i wybiera kilku. Eksperci ci to zazwyczaj bloki przekazujące informacje, a nie kompletne modele z profesjami czytelnymi dla człowieka. Jeden ekspert nie jest rzetelnie „ekspertem poezji”, a inny „ekspertem matematyki”, nawet jeśli specjalizacja wyłoni się w trakcie szkolenia.

Wybrane wyniki są łączone i przetwarzanie jest kontynuowane. Decyzja następuje wielokrotnie, często dla każdego tokenu i na kilku warstwach, więc sąsiednie słowa mogą przebiegać różnymi drogami.

Wybory routera mają charakter numeryczny, a nie świadomy. Eksperci uczą się poprzez szkolenia, a ich role mogą się pokrywać lub być trudne do jednoznacznej interpretacji.

Modele gęste i rzadkie zużywają pojemność w różny sposób

Gęsty model języka wykorzystuje zasadniczo ten sam zestaw parametrów dla każdego tokenu. Zwiększanie liczby parametrów zazwyczaj zwiększa obciążenie obliczeń i pamięci wymagane na każdym etapie generowania. Rzadki MoE może zwiększyć całkowite parametry, utrzymując aktywny podzbiór na stosunkowo stabilnym poziomie.

The Zmień papier transformatorowy uprościło ten pomysł, kierując każdy token do jednego eksperta w swoich warstwach MoE. Jego eksperymenty wykazały szybsze szkolenie wstępne niż gęste modele porównawcze w warunkach autorów. Wyniki te pokazują potencjał architektury; nie są one uniwersalnym współczynnikiem energii dla obecnych produktów do czatowania.

To rozróżnienie wyjaśnia, dlaczego całkowita liczba parametrów może wprowadzać w błąd. Ministerstwo Środowiska reklamowane jako bardzo duże może wykonywać arytmetykę na znacznie mniejszej liczbie parametrów na token. Jednak nieaktywni eksperci nadal zajmują pamięć akceleratora i być może trzeba będzie ich rozdzielić między maszynami.

Liczby aktywnych parametrów również wymagają kontekstu. Warstwy dzielonej uwagi i osadzania nadal działają, więc wybrane wagi eksperckie niekoniecznie stanowią całe aktywne obciążenie modelu.

Router musi zapewnić specjalistom zajęcie

Jeśli router wyśle większość tokenów do tego samego eksperta, ten ekspert stanie się kolejką, podczas gdy inni będą czekać bezczynnie. Dlatego w szkoleniu wykorzystuje się mechanizmy równoważące, które zachęcają do rozłożenia ruchu pomiędzy ekspertami. Systemy ustalają również limity pojemności dotyczące liczby tokenów, które ekspert akceptuje w partii.

Na początku treningu routing może być niestabilny. Eksperci mogą nauczyć się podobnych funkcji lub niektórzy mogą otrzymać za mało danych. Inżynierowie dostosowują straty pomocnicze, pojemność, hałas i rozmieszczenie, aby poprawić równowagę bez szkody dla jakości modelu.

Obsługa wiąże się z problemem fizycznym: wybrani eksperci mogą żyć na różnych akceleratorach. Tokeny następnie przemieszczają się przez szybką sieć pomiędzy udostępnionymi warstwami i blokami ekspertów. Komunikacja może ograniczać prędkość i zwiększać energię, szczególnie w przypadku małych partii lub złego rozmieszczenia. Rzadka arytmetyka to tylko jedna część maszyny.

Limity pojemności stwarzają kolejny kompromis. Upuszczanie, opóźnianie lub przekierowywanie nadmiaru tokenów może chronić przepustowość, ale implementacja musi zachować jakość odpowiedzi w przypadku nierównego rzeczywistego ruchu.

Dlaczego MoE może być skuteczne

MoE oferuje większą pojemność reprezentacyjną bez konieczności każdorazowej aktywacji całej sieci. W przypadku jakości docelowej, która może ograniczyć obliczenia uczenia lub wnioskowania w porównaniu z gęstym modelem o podobnych możliwościach. Może także umożliwić różnym ekspertom nauczenie się przydatnych wzorców z różnych języków lub dziedzin.

Skuteczność zależy od wdrożenia. Duże partie mogą zająć ekspertów i sprawić, że komunikacja będzie opłacalna. Kwantyzacja może zmniejszyć ruch w pamięci. Dobry routing i topologia sprzętu zmniejszają zatory. Model obsługiwany przy niskim wykorzystaniu może nie zapewnić realizacji tych korzyści.

Co najważniejsze, mniejsza liczba obliczeń na token nie gwarantuje niższej energii na ukończone zadanie. Dłuższe wyniki, ponowne próby, duże okna kontekstowe i narzędzia agenta mogą przeważyć nad oszczędnościami w architekturze. Jak zmniejszyć ślad węglowy AI koncentruje się na całej pracy, a nie na jednej atrakcyjnej właściwości modelu.

Dlatego też, jeśli są dostępne, preferowane są pomiary operacyjne, a nie szacunki papierowe. Moc, opóźnienia i powodzenie należy porównać na tym samym sprzęcie, warunkach wsadowych i reprezentatywnych żądaniach.

Dlaczego MoE to nie to samo, co mały model

A mały model językowy ma mniej parametrów całkowitych i często mieści się na skromnym sprzęcie. Ministerstwo Środowiska może obejmować bardzo duży zbiór ekspertów, ale aktywować tylko kilku. Jego arytmetyka dla jednego tokena może wyglądać na mniejszą niż jego całkowity rozmiar, ale jego przechowywanie i wdrażanie może pozostać znaczne.

Ma to znaczenie dla szacunków środowiskowych. Obliczenia oparte wyłącznie na parametrach całkowitych mogą zawyżać obliczenia aktywne. Ten oparty wyłącznie na aktywnych parametrach może pominąć pamięć, sieć, pojemność bezczynną i infrastrukturę wspierającą. Żadna liczba sama w sobie nie jest miarą mocy obiektu.

Porównując modele, zapytaj o parametry całkowite, aktywne parametry na token, precyzję liczbową, typowy kontekst i długość wyjściową oraz używany sprzęt. Następnie przetestuj jakość i energię dla tego samego, kompletnego zadania.

W przypadku wdrożenia lokalnego ograniczeniem wiążącym może być całkowita pamięć, nawet jeśli aktywne obliczenia wydają się możliwe do zarządzania. Gęsty, kompaktowy model może być bardziej praktyczną opcją w przypadku ograniczonego sprzętu.

Co Ministerstwo Środowiska zmienia dla użytkowników

Użytkownicy zazwyczaj nie mogą kontrolować routingu wewnątrz hostowanego modelu. Mogą kontrolować żądanie: zapewnić odpowiedni kontekst, poprosić o proporcjonalne wyniki i uniknąć niepotrzebnych regeneracji. Dostawcy modeli kontrolują rozmieszczenie ekspertów, porcjowanie, pojemność i wydajność sprzętu.

Model Ministerstwa Środowiska może być dobrym wyborem w przypadku szerokiej usługi, ponieważ łączy w sobie wydajność z rzadką aktywacją. Może to być nadal nadmierne w przypadku prostej ekstrakcji, z którą poradzi sobie kompaktowy, gęsty model. Zielona sztuczna inteligencja oznacza wybór pomiędzy architekturami w oparciu o dostarczoną wartość i zmierzone zasoby, bez zakładania, że rzadkie zawsze wygrywają.

Treechat paragon szacuje energię operacyjną na podstawie wybranego modelu i liczby tokenów, a następnie dodaje podane koszty ogólne centrum danych. Ponieważ dostawcy nie ujawniają routingu eksperckiego na żywo ani mocy na odpowiedź, pozostaje to przybliżenie oparte na modelu. Założenia i wyłączenia są publikowane pod adresem /methodology.

Proste podsumowanie jest takie, że mieszanka ekspertów oddziela to, ile model wie od tego, ile z tego działa jednocześnie. Może to sprawić, że duża pojemność będzie bardziej wydajna obliczeniowo, ale pamięć, komunikacja i rzeczywiste zachowanie w zakresie obciążenia decydują o tym, czy obietnica stanie się rzeczywistą oszczędnością.

Mieszanka ekspertów, wyjaśniona w prosty sposób · Treechat blog