MoE: parametry całkowite i aktywne — ile pamięci potrzebujesz?
Tłumaczenie automatyczne
Ten artykuł został automatycznie przetłumaczony z angielskiego oryginału.
Całkowita liczba parametrów MoE obejmuje wszystkich ekspertów i współdzielone komponenty modelu. Parametry aktywne opisują podzbiór używany do obliczeń dla jednego tokena, w tym komponenty współdzielone. Model z niewielką liczbą aktywnych parametrów może nadal wymagać dużej ilości pamięci, ponieważ różne tokeny mogą wybierać różnych ekspertów.
Dla inżynierów wdrożeniowych: używaj wszystkich wag do szacowania miejsca, a aktywnych obliczeń do oceny operacji arytmetycznych. Żadna z tych liczb samodzielnie nie przewiduje opóźnienia obsługi modelu.
Co wybiera router
Model mieszaniny ekspertów zastępuje wybrane sieci jednokierunkowe kilkoma sieciami ekspertów. Router wybiera niewielką liczbę ekspertów dla każdego tokena i łączy ich wyniki. Współdzieleni eksperci, jeśli występują, działają dla każdego tokena. Inne komponenty, w tym mechanizm uwagi, pozostają częścią aktywnych obliczeń.
Eksperci nie muszą być mniejsi od sieci jednokierunkowej w porównywalnym modelu gęstym. Nie każda warstwa musi korzystać z ekspertów: DeepSeek-V3 zachowuje trzy pierwsze warstwy jako gęste.
| Model | Parametry całkowite | Parametry aktywne na token | Układ ekspertów |
|---|---|---|---|
| Mixtral 8x7B | Około 47B | Około 13B | Ośmiu ekspertów wybieranych przez routing; wybiera dwóch na warstwę MoE |
| DeepSeek-V3 | 671B | 37B | 256 ekspertów wybieranych przez routing i jeden współdzielony; wybiera ośmiu ekspertów routowanych na warstwę MoE |
Liczby pochodzą z publikacji o Mixtral i DeepSeek-V3. Nie oznaczają, że dla całej usługi wystarczy przechowywać tylko wybrane wagi.
Osobno określ wymagania dotyczące przechowywania i wykonania
Przy dwóch bajtach na wagę 671 miliardów wag wymaga około 1,34 TB miejsca na same wagi, bez stanu pamięci podręcznej, metadanych i buforów środowiska wykonawczego. Kwantyzacja może zmniejszyć objętość danych wag. Podział może rozmieścić je na wielu urządzeniach; przenoszenie do innej pamięci zmienia wymagania dotyczące transferu danych. Żadna z tych możliwości nie wynika z liczby 37B aktywnych parametrów.
Routing wpływa również na wykonanie. Partia może wysłać wiele tokenów do jednego eksperta, a niewiele do innego. Równoległe wykonywanie ekspertów przenosi reprezentacje tokenów między urządzeniami, dodając komunikację. Większa partia może poprawić wykorzystanie operacji macierzowych, a jednocześnie zmienić zestaw ekspertów, których trzeba uruchomić.
Sprawdź dokładny checkpoint, precyzję, rozmieszczenie ekspertów, obsługiwane jądra obliczeniowe, topologię sieci i szczytowe zużycie pamięci. Zmierz fazy przetwarzania promptu i dekodowania przy realistycznej współbieżności. Uwzględnij obciążenia z nierównomiernym routingiem, jeśli występują w Twoim ruchu. Oceniaj koszt na podstawie zmierzonego opóźnienia na token i goodput, zamiast traktować aktywną liczbę parametrów jako wzór na cenę całej obsługi.
Przewodnik inżynierski: mieszanina ekspertów omawia też równoważenie routingu podczas treningu.