Treechat
Menu
Wypróbuj za darmo
Wszystkie wpisy

Ile energii wytwarza a ChatGPT użycie zapytania?

Szczera odpowiedź to zakres, a nie pojedyncza liczba. Oto, co jest publiczne, co szacuje się, a co pomija.

Autor Treechat6 min czytania
Pojedyncza wstęga podpowiedzi przechodzi przez procesor i fizyczny licznik energii.

Krótka odpowiedź jest taka, że zwykłe zapytanie tekstowe prawdopodobnie zużywa ułamek watogodziny, ale nie ma uniwersalnego „ChatGPT zapytanie”. Prośba o poprawienie zdania i zadanie polegające na dogłębnych badaniach, w ramach którego czyta się dziesiątki źródeł, to różne zadania obliczeniowe. Traktowanie ich jako wymiennych sprawia, że ​​każda precyzyjnie wyglądająca figurka jest mniej przydatna, niż się wydaje.

Nie oznacza to, że nic nie wiemy. W 2025 r. OpenAI dyrektor naczelny Sam Altman napisał to średnio ChatGPT zapytanie używa około 0.34 watogodzin. Mniej więcej w tym samym czasie niezależni badacze z Epoch AI oszacowali mniej więcej 0.3 watogodzin dla typowego GPT-4o zapytanie. Umowa jest godna uwagi, ale to nie to samo, co publiczny, niezależnie audytowany pomiar. Altman nie opublikował obliczeń stojących za jego liczbą, podczas gdy Epoch musiał przyjąć założenia dotyczące modelu, sprzętu, wykorzystania i liczby tokenów.

Zatem 0.3–0.34 Wh jest użytecznym punktem odniesienia dla zwykłej wymiany tekstowej, takiej jak opisują te szacunki. Nie jest to odczyt licznika dla konkretnego monitu i nie należy go rozciągać, aby obejmował każdy tryb lub model.

Dlaczego jedno zapytanie może bardzo różnić się od drugiego

Odpowiedź AI jest generowana token po tokenie. Ogólnie rzecz biorąc, więcej danych wejściowych do procesu i więcej wyników do wygenerowania oznacza więcej pracy. Krótka, rzeczowa odpowiedź może szybko się zakończyć. Długa rozmowa przenosi poprzedni kontekst do przodu. Przesłanie istotnego dokumentu zwiększa początkowe koszty przetwarzania. Model rozumujący może generować ukryte tokeny działania, zanim pokaże odpowiedź. Narzędzia do wyszukiwania, generowania obrazów i agentów mogą wywoływać kilka systemów, a nie jeden.

Przykłady opracowane przez firmę Epoch wyjaśniają skalę tej odmiany. Jego model umieścił zapytanie z a 10,000-wejście tokena w okolicach 2.5 Wh i jeden z 100,000-wejście tokena w pobliżu 40 Wh, zgodnie z przyjętymi założeniami. To nie są szacunki dotyczące przeciętnego czatu. Pokazują, dlaczego samo słowo „zapytanie” jest zbyt wulgarne.

Model też ma znaczenie. Mniejszy model zazwyczaj wykonuje mniej obliczeń na wygenerowany token niż duży, chociaż architektura, kwantyzacja, optymalizacja sprzętu i oprogramowania komplikują porównanie. Modele złożone z ekspertów aktywują tylko część całkowitej liczby parametrów dla każdego tokena. Nowoczesne akceleratory mogą wykonać więcej pracy na jednostkę energii elektrycznej niż starszy sprzęt. Efektywne grupowanie pozwala jednemu serwerowi obsługiwać jednocześnie kilku użytkowników, ale pusty lub rzadko używany serwer może być mniej wydajny w przeliczeniu na odpowiedź.

Następnie wokół chipów znajduje się centrum danych. Chłodzenie, tworzenie sieci i konwersja mocy również zużywają energię elektryczną. Badacze często uwzględniają ten narzut za pomocą współczynnika efektywności zużycia energii. Wynik zależy również od tego, gdzie i kiedy wytwarzana jest energia elektryczna: watogodzina to wszędzie ta sama energia, ale związane z nią emisje różnią się w zależności od struktury sieci.

Co właściwie jest liczone?

Większość danych dotyczących zapytania opisuje energię operacyjną w celu wyciągnięcia wniosków: energię zużytą w czasie, gdy usługa generuje odpowiedź, plus pewien dodatek na koszty ogólne centrum danych. Nie mogą one obejmować telefonu lub laptopa użytkownika, transmisji sieciowej, przechowywania danych, szkolenia modeli, produkcji chipów i budynków ani infrastruktury utrzymywanej w gotowości pomiędzy żądaniami.

Nie ma jednej prawidłowej granicy dla każdego pytania. Jeśli porównujesz dwie opcje wnioskowania, przydatna jest energia operacyjna na odpowiedź. Jeśli przygotowujesz inwentaryzację emisji dwutlenku węgla obejmującą całą firmę, bardziej odpowiednia może być szersza granica cyklu życia. Problemy zaczynają się, gdy wąski szacunek jest przedstawiany jako cały koszt środowiskowy lub gdy szeroki szacunek jest porównywany z wąskim.

Szkolenia zasługują na osobne potraktowanie. Jest to duże, okazjonalne zadanie, którego wpływ można rozłożyć na nieznaną liczbę przyszłych zastosowań. Podziel go przez więcej wiadomości, a jego udział w wiadomościach zmniejszy się; obejmują model, który można szybko wymienić i podnieść. Przydział może pomóc w rozliczeniu, ale w momencie naciśnięcia przycisku „Wyślij” nie jest to pobierana energia elektryczna.

Ta sama ostrożność dotyczy wody i węgla. Zużycie wody zależy od technologii chłodzenia i łańcucha dostaw energii elektrycznej. Emisja dwutlenku węgla zależy od lokalizacji, czasu i tego, czy w rozliczeniu uwzględniany jest koszyk fizycznej sieci, czy kontraktowe zakupy energii odnawialnej. Przeliczenie Wh na gramy węgla bez podania tych opcji skrywa ważną niepewność.

Jak podróżowała stara liczba 3 Wh

Przez kilka lat w artykułach często pojawiała się informacja: a ChatGPT żądanie zużyło około 3 Wh, czasami w połączeniu z twierdzeniem, że było to dziesięć razy dziennie Google szukaj. Liczba ta pochodziła z wczesnych szacunków, w których wykorzystano starszy sprzęt A100, a GPT-3.5-scale model i zakładane 2,000 tokenów wyjściowych. Epoch AI wyjaśnia, dlaczego uważa te założenia za niereprezentatywne dla typowego współczesnego zastosowania w swoim systemie metodologia i porównanie.

Dobrą praktyką jest aktualizowanie szacunków w przypadku zmiany sprzętu i usług. Nie dowodzi to, że zużycie energii przez sztuczną inteligencję jest nieistotne. Oznacza to, że popularna liczba na zapytanie źle się zestarzała.

Porównanie z wyszukiwarką internetową jest niepewne z innego powodu: pochodzi z często cytowanej liczby wyszukiwań Google w 2009 r. Wyszukiwanie obecnie wykorzystuje inną infrastrukturę i czasami obejmuje wygenerowane podsumowania. Umieszczenie najnowszego oszacowania AI obok starego oszacowania wyszukiwania tworzy pozornie prosty stosunek na podstawie różnych pomiarów.

Jak liczby są nadużywane w obie strony

Jednym z nadużyć jest przyjęcie wysokiej klasy lub nieaktualnego oszacowania, pomnożenie go przez ogromną liczbę wyimaginowanych żądań i przedstawienie wyniku jako zmierzonej sumy. Może to wyolbrzymić zwykłe użycie tekstu i odwrócić uwagę od rzeczywiście bardziej intensywnych zadań.

Przeciwne niewłaściwe użycie zaczyna się od niskiej średniej i kończy się tym, że nie ma nic do rozważenia. Niewielka ilość pomnożona przez duże i rosnące wykorzystanie nadal stanowi zapotrzebowanie systemowe. The Prace Międzynarodowej Agencji Energetycznej nad energią i sztuczną inteligencją analizuje zapotrzebowanie centrum danych na poziomie systemu. Zarówno wydajność na zapytanie, jak i całkowity wzrost zużycia energii mogą być prawdziwe, gdy wzrasta wykorzystanie, a nowe zadania wymagają większej mocy obliczeniowej.

Kolejnym błędem jest fałszywa precyzja. „0.34 Wh” brzmi z dokładnością do dwóch miejsc po przecinku, ale w publicznym oświadczeniu opisano średnią z nieujawnionej kombinacji żądań. Bardziej uczciwe jest zachowanie kontekstu i niepewności, niż przekształcanie ich w uniwersalną stałą.

Jak Treechat szacuje wiadomość

Treechat nie można odczytać miernika mocy dołączonego do każdej odpowiedzi. Dostawcy nie ujawniają tego pomiaru. Zamiast tego szacujemy i oznaczamy wynik jako szacunkowy.

Nasze obliczenia rozpoczynają się od zastosowanego modelu oraz przetworzonych i wygenerowanych tokenów. Stosuje metodologię energetyczną opartą na modelu publicznym, dodaje obciążenie centrum danych i przekształca energię elektryczną w szacowane emisje przy użyciu średniej intensywności emisji dwutlenku węgla w sieci. Założenia i aktualne stałe są podane na naszej stronie strona metodologiczna.

Domyślnie kierujemy codzienne zamówienia do mniejszego modelu, ponieważ wybór modelu to jedna dźwignia, za którą możemy pociągnąć. Zamiast podawać dokładny pomiar, w odpowiedzi pokazujemy również szacunkowy rachunek. Tam, gdzie dowody są niekompletne, zaokrąglamy to przeciwko sobie. Wolelibyśmy nie doceniać oszczędności, niż składać zgrabną obietnicę, której dane nie mogą potwierdzić.

Najbardziej możliwa do obrony odpowiedź nie brzmi zatem: „a ChatGPT zapytanie używa dokładnie X”. To jest tak: zwykłe zapytania tekstowe wydają się, według najnowszych publicznych szacunków, zużywać około ułamka watogodziny, podczas gdy długi kontekst, rozumowanie i praca wymagająca wielu narzędzi mogą zużywać znacznie więcej. Zapytaj, który model, ile tokenów, jaki sprzęt i jaka granica. Bez tych szczegółów liczba jest drogowskazem, a nie faktem dotyczącym każdego zapytania.

Ile energii wytwarza a ChatGPT użycie zapytania? · Treechat blog