Treechat
Menu
Wypróbuj za darmo
Wszystkie wpisy

Czym są małe modele językowe?

Małe modele językowe wykorzystują mniej parametrów i mniej mocy obliczeniowej niż duże modele, dzięki czemu są praktyczne w przypadku ukierunkowanych zadań, zastosowań lokalnych i wydajnych usług sztucznej inteligencji.

Autor Treechat5 min czytania
Skoncentrowany mały warsztat wykonuje zadanie obok znacznie większej fabryki ogólnego przeznaczenia.

Małe modele językowe, czyli SLM, to modele językowe zaprojektowane z mniejszą liczbą parametrów i mniejszymi wymaganiami obliczeniowymi niż duże modele używane na granicy. Mogą podsumowywać, wydobywać informacje, przepisywać tekst, klasyfikować treść i odpowiadać na konkretne pytania, często przy niższych opóźnieniach, mniejszym zużyciu pamięci i energii na token.

Nie ma oficjalnego progu parametrów, przy którym model staje się „mały”. Termin odnosi się do sprzętu, okresu i porównania. Model mieszczący się na telefonie jest wyraźnie mały w porównaniu z modelem przeznaczonym dla centrum danych, ale dwóch dostawców może inaczej stosować etykietę. Przydatne pytania dotyczą tego, jaka część modelu jest aktywna, jakiego sprzętu potrzebuje i czy niezawodnie wykonuje Twoje zadanie.

Model językowy może być użyteczny, ale nie ogromny

Modele językowe uczą się wzorców liczbowych z tekstu i wykorzystują je do przewidywania tokenów. Większe modele mogą przechowywać więcej parametrów i często dobrze radzą sobie z szerszym zakresem nieznanych zadań. Wymagają także więcej pamięci i obliczeń, aby trenować i służyć.

Małe modele rezygnują z pewnej szerokości w zamian za wydajność. Dokładne dane szkoleniowe, destylacja i ukierunkowane dostrajanie mogą zapewnić wysoką wydajność w przypadku typowych lub wąskich zadań. Microsoftu Raport techniczny Phi-3na przykład opisuje model o 3.8 miliardach parametrów, zaprojektowany tak, aby nadawał się do wdrożenia w telefonie. Wyniki jego testów porównawczych należą do tego modelu i zestawu testów; nie dowodzą, że każdy mały model może konkurować z większym.

Dlatego „mały” opisuje klasę zasobu, a nie gwarancję jakości. Kompaktowy model może być doskonały w ekstrakcji i słaby w skomplikowanym rozumowaniu, podobnie jak duży model może być niepotrzebny przy rutynowym formatowaniu.

Należy także podać datę porównania. To, co kilka lat temu uważano za kompaktowe, teraz może wyglądać zwyczajnie, gdy konstrukcja sprzętu i modelu ulegnie poprawie.

Dlaczego małe modele zwykle potrzebują mniej energii

W konwencjonalnym gęstym transformatorze wygenerowanie tokena wymaga obliczeń dla większości wag modelu. Mniej parametrów zazwyczaj oznacza mniej wartości do przejścia przez pamięć i mniej operacji do wykonania. Model kompaktowy może również działać na mniejszym sprzęcie i obsługiwać więcej żądań w ramach danego budżetu pamięci.

Dlatego rozmiar modelu jest użyteczną dźwignią środowiskową. To nie jest miernik mocy. Precyzja numeryczna, długość sekwencji, dozowanie, generowanie akceleratorów i optymalizacja oprogramowania – wszystko to zmienia energię na wynik. Źle wykorzystywany mały model może marnować pojemność, podczas gdy większy model, który odniesie sukces raz, może pokonać powtarzające się nieudane wywołania słabszego.

Nasz artykuł nt jak zmniejszyć ślad węglowy AI stosuje praktyczną zasadę: wybierz najmniejszy model, który solidnie wykona całe zadanie. Licz ponowne próby i poprawki, zamiast porównywać jeden izolowany token.

Długość wejściowa może zawęzić przewagę. Przetwarzanie ogromnego dokumentu na kompaktowym modelu to wciąż sporo pracy, więc dyscyplina kontekstowa pozostaje przydatna przy każdym rozmiarze modelu.

Jak małe modele stają się zdolne

Konstruktorzy modeli nie tylko usuwają warstwy. Opiekują się danymi szkoleniowymi, dzięki czemu ograniczone możliwości są wykorzystywane na przydatne wzorce, uczą mniejszych modeli na podstawie wyników lub reprezentacji większych nauczycieli i dostosowują je do określonych dziedzin. Kwantyzacja przechowuje i oblicza wagi z mniejszą precyzją, zmniejszając pamięć i często przyspieszając wnioskowanie.

Przycinanie usuwa ciężary lub struktury, które uznano za mające niewielki wpływ. Funkcja wyszukiwania może dostarczyć odpowiednie dokumenty na żądanie, zamiast wymagać od modelu zapamiętania każdego faktu. Dobry projekt aplikacji zawęża problem dzięki ustrukturyzowanym danym wejściowym, narzędziom i walidacji.

Każda technika ma kompromisy. Destylacja może odtworzyć ograniczenia nauczyciela. Agresywna kwantyzacja może obniżyć jakość. Wąskie dostrojenie może osłabić ogólne zachowanie. Twierdzenia należy testować na podstawie rzeczywistych wymagań dotyczących zadania, języka i bezpieczeństwa, a nie wywnioskować wyłącznie na podstawie liczby parametrów.

Dane ewaluacyjne wymagają podobnej opieki. Model może sprawiać wrażenie zdolnego, ponieważ jego materiały szkoleniowe pokrywają się z wzorcem, a jednocześnie nie radzą sobie z nowymi przykładami z zastosowania, któremu ma służyć.

Gdzie małe modele językowe sprawdzają się dobrze

Skoncentrowana, powtarzalna praca jest naturalnym terytorium. Przykłady obejmują klasyfikowanie zgłoszeń do pomocy technicznej, wyodrębnianie pól ze znanych typów dokumentów, sugerowanie krótkich odpowiedzi, przepisywanie tekstu w stylu domu i odpowiadanie na pytania z kontrolowanej bazy wiedzy. Mniejsze opóźnienia i koszty mogą sprawić, że wdrożenie lokalne lub brzegowe będzie praktyczne.

Uruchomienie lokalne może poprawić prywatność, ponieważ dane nie muszą opuszczać urządzenia, chociaż rzeczywiste zachowanie aplikacji w sieci nadal ma znaczenie. Może także uniknąć ciągłego dostępu do sieci. Lokalne wnioskowanie nie jest automatycznie niskoemisyjne: stary laptop wykonujący powolną pracę może zużywać więcej energii niż wydajny serwer współdzielony, a ślad urządzenia pozostaje.

Małe modele są mniej niezawodne w przypadku złożonego, wieloetapowego rozumowania, niejasnej wiedzy, długich dokumentów i trudnego kodu. Eskalacja jest rozsądna, gdy testy wykażą, że zadanie przekracza ich możliwości. Zrównoważony design nie jest zakazem dla dużych modeli; jest to celowe wyznaczanie trasy.

Granica może być widoczna dla użytkowników. Usługa może wyjaśnić, że rutynowa praca korzysta z szybkiego modelu i oferować celową aktualizację w przypadkach, w których lepsze rozumowanie jest warte opóźnienia i zasobów.

Mały, rzadki i wyspecjalizowany nie są synonimami

Mały model językowy ma stosunkowo niewielki całkowity rozmiar parametrów i pamięci. Wyspecjalizowany model jest szkolony lub dostrajany pod kątem wąskiej domeny, niezależnie od jej rozmiaru. Model rzadki zawiera wiele parametrów, ale aktywuje tylko część z nich dla danego wejścia.

Ta ostatnia kategoria obejmuje modele złożone z ekspertów. Mogą mieć dużą całkowitą liczbę parametrów, używając mniejszego aktywnego podzbioru dla każdego tokena. Obliczenia mogą przypominać mniejszy, gęsty model, ale wszyscy eksperci nadal muszą być przechowywani i rozpowszechniani, aby pamięć i komunikacja nie zniknęły.

Gdy dostawca promuje „mały” lub „wydajny” model, zapytaj o parametry całkowite i aktywne, wymagania sprzętowe, tokeny na sekundę, granicę energii i jakość zadania. Żadna etykieta nie odpowiada na wszystkie te pytania.

Należy także rozróżnić plik modelu do pobrania od pamięci wymaganej podczas jego działania. Kontekst roboczy, pamięci podręczne i procesy aplikacji mogą sprawić, że wdrożenie będzie większe, niż sugerują same wagi.

Jak wybrać odpowiedzialnie

Zbuduj reprezentatywny zestaw ocen, obejmujący trudne i wrażliwe na bezpieczeństwo przykłady. Przetestuj najmniejszego kandydata, zapisz sukces, opóźnienie i szacunkową lub zmierzoną energię, a następnie porównaj następny model w tych samych warunkach. Uwzględnij pobieranie, wywoływanie narzędzi, ponowne próby i poprawianie przez człowieka.

W przypadku organizacji należy monitorować dystrybucję po uruchomieniu. Router, który wysyła większość rutynowego ruchu do małego modelu i prawdziwe wyjątki do większego, może zachować jakość bez domyślnego ustawiania każdego żądania na maksymalną moc obliczeniową. Praktyczny przewodnik po zrównoważonej sztucznej inteligencji obejmuje pomiar i zarządzanie tym wzorcem.

Treechat wykorzystuje mniejsze modele do codziennych pytań i oferuje większe możliwości w razie potrzeby. Na rachunku za każdą odpowiedź szacuje się energię operacyjną wynikającą z użycia modelu i tokena, dodaje się opublikowane koszty ogólne centrum danych i stosuje określony współczynnik sieci. Nie jest to bezpośredni pomiar sprzętu. Obecne czynniki i ograniczenia są na /methodology.

Małe modele językowe mają znaczenie, ponieważ większość codziennej pracy językowej nie wymaga największego dostępnego systemu. Wykorzystywane w granicach swoich możliwości mogą sprawić, że sztuczna inteligencja będzie szybsza, tańsza i mniej energochłonna. Używany jako etykieta marketingowa bez testów i pomiarów zadaniowych, „mały” mówi bardzo niewiele.