MoE: сколько памяти нужно при общем и активном числе параметров?

Автоматический перевод

Эта статья была автоматически переведена с оригинальной английской версии.

Общее число параметров MoE включает всех экспертов и общие компоненты модели. Активные параметры — это подмножество, которое используется при вычислениях для одного токена, включая общие компоненты. Модель с небольшим числом активных параметров всё равно может требовать много памяти, поскольку разные токены могут выбирать разных экспертов.

Инженерам, отвечающим за деплой, следует оценивать объём хранения по всем весам, а арифметические операции — по активным вычислениям. Ни одно из этих чисел само по себе не предсказывает латентность сервинга.

Что выбирает роутер

Модель смеси экспертов заменяет некоторые сети прямого распространения несколькими сетями экспертов. Роутер выбирает небольшое число экспертов для каждого токена и объединяет их выходные данные. Общие эксперты, если они есть, выполняются для каждого токена. Другие компоненты, включая аттеншн, остаются частью активных вычислений.

Эксперты не обязательно меньше сети прямого распространения в сопоставимой плотной модели. Не каждый слой должен использовать экспертов: DeepSeek-V3 оставляет первые три слоя плотными.

МодельОбщее число параметровАктивных параметров на токенОрганизация экспертов
Mixtral 8x7BОколо 47BОколо 13BВосемь экспертов, выбираемых роутером; выбирает двух на каждый MoE-слой
DeepSeek-V3671B37B256 экспертов, выбираемых роутером, и один общий; выбирает восемь экспертов через роутинг на каждый MoE-слой

Числа взяты из статей о Mixtral и DeepSeek-V3. Они не означают, что для всего сервиса нужно хранить только выбранные веса.

Оценивайте хранение и выполнение отдельно

При двух байтах на вес 671 миллиард весов требует примерно 1,34 TB только для хранения весов, без состояния кэша, метаданных и буферов рантайма. Квантизация может уменьшить объём данных весов. Шардинг может распределить их по устройствам; выгрузка в другую память меняет требования к передаче данных. Ничто из этого не следует из числа 37B активных параметров.

Роутинг также влияет на выполнение. Батч может направить много токенов одному эксперту и мало — другому. При параллельном выполнении экспертов представления токенов передаются между устройствами, что добавляет обмен данными. Больший батч может повысить эффективность матричных операций и при этом изменить набор экспертов, которые нужно выполнить.

Проверьте конкретный чекпоинт, точность, размещение экспертов, поддерживаемые вычислительные ядра, топологию сети и пиковое потребление памяти. Измерьте фазы обработки промпта и декодирования при реалистичной параллельной нагрузке. Включите нагрузки с неравномерным роутингом, если они встречаются в вашем трафике. Оценивайте стоимость по измеренной латентности на токен и goodput, а не считайте активные параметры формулой цены всего процесса.

Инженерное руководство: смесь экспертов также описывает балансировку роутинга при обучении.