MoE: parametry całkowite i aktywne — ile pamięci potrzebujesz?

Tłumaczenie automatyczne

Ten artykuł został automatycznie przetłumaczony z angielskiego oryginału.

Całkowita liczba parametrów MoE obejmuje wszystkich ekspertów i współdzielone komponenty modelu. Parametry aktywne opisują podzbiór używany do obliczeń dla jednego tokena, w tym komponenty współdzielone. Model z niewielką liczbą aktywnych parametrów może nadal wymagać dużej ilości pamięci, ponieważ różne tokeny mogą wybierać różnych ekspertów.

Dla inżynierów wdrożeniowych: używaj wszystkich wag do szacowania miejsca, a aktywnych obliczeń do oceny operacji arytmetycznych. Żadna z tych liczb samodzielnie nie przewiduje opóźnienia obsługi modelu.

Co wybiera router

Model mieszaniny ekspertów zastępuje wybrane sieci jednokierunkowe kilkoma sieciami ekspertów. Router wybiera niewielką liczbę ekspertów dla każdego tokena i łączy ich wyniki. Współdzieleni eksperci, jeśli występują, działają dla każdego tokena. Inne komponenty, w tym mechanizm uwagi, pozostają częścią aktywnych obliczeń.

Eksperci nie muszą być mniejsi od sieci jednokierunkowej w porównywalnym modelu gęstym. Nie każda warstwa musi korzystać z ekspertów: DeepSeek-V3 zachowuje trzy pierwsze warstwy jako gęste.

ModelParametry całkowiteParametry aktywne na tokenUkład ekspertów
Mixtral 8x7BOkoło 47BOkoło 13BOśmiu ekspertów wybieranych przez routing; wybiera dwóch na warstwę MoE
DeepSeek-V3671B37B256 ekspertów wybieranych przez routing i jeden współdzielony; wybiera ośmiu ekspertów routowanych na warstwę MoE

Liczby pochodzą z publikacji o Mixtral i DeepSeek-V3. Nie oznaczają, że dla całej usługi wystarczy przechowywać tylko wybrane wagi.

Osobno określ wymagania dotyczące przechowywania i wykonania

Przy dwóch bajtach na wagę 671 miliardów wag wymaga około 1,34 TB miejsca na same wagi, bez stanu pamięci podręcznej, metadanych i buforów środowiska wykonawczego. Kwantyzacja może zmniejszyć objętość danych wag. Podział może rozmieścić je na wielu urządzeniach; przenoszenie do innej pamięci zmienia wymagania dotyczące transferu danych. Żadna z tych możliwości nie wynika z liczby 37B aktywnych parametrów.

Routing wpływa również na wykonanie. Partia może wysłać wiele tokenów do jednego eksperta, a niewiele do innego. Równoległe wykonywanie ekspertów przenosi reprezentacje tokenów między urządzeniami, dodając komunikację. Większa partia może poprawić wykorzystanie operacji macierzowych, a jednocześnie zmienić zestaw ekspertów, których trzeba uruchomić.

Sprawdź dokładny checkpoint, precyzję, rozmieszczenie ekspertów, obsługiwane jądra obliczeniowe, topologię sieci i szczytowe zużycie pamięci. Zmierz fazy przetwarzania promptu i dekodowania przy realistycznej współbieżności. Uwzględnij obciążenia z nierównomiernym routingiem, jeśli występują w Twoim ruchu. Oceniaj koszt na podstawie zmierzonego opóźnienia na token i goodput, zamiast traktować aktywną liczbę parametrów jako wzór na cenę całej obsługi.

Przewodnik inżynierski: mieszanina ekspertów omawia też równoważenie routingu podczas treningu.