MoE: parâmetros totais e ativos, de quanta memória precisa?
Tradução automática
Este artigo foi traduzido automaticamente a partir da versão original em inglês.
O número total de parâmetros de MoE inclui todos os especialistas e componentes partilhados do modelo. Os parâmetros ativos descrevem o subconjunto usado no cálculo de um token, incluindo os componentes partilhados. Um modelo com poucos parâmetros ativos pode ainda precisar de muita memória, porque diferentes tokens podem selecionar diferentes especialistas.
Para engenheiros responsáveis pela implementação: use todos os pesos para estimar o armazenamento e o cálculo ativo para compreender as operações aritméticas. Nenhum dos dois números, por si só, prevê a latência do serving.
O que o encaminhador seleciona
Um modelo de mistura de especialistas substitui determinadas redes de propagação direta por várias redes de especialistas. Um encaminhador escolhe um pequeno número de especialistas para cada token e combina as suas saídas. Os especialistas partilhados, quando existem, são executados para cada token. Outros componentes, incluindo a atenção, continuam a fazer parte do cálculo ativo.
Os especialistas não são necessariamente mais pequenos do que a rede de propagação direta de um modelo denso comparável. Nem todas as camadas têm de usar especialistas: DeepSeek-V3 mantém densas as suas primeiras três camadas.
| Modelo | Parâmetros totais | Parâmetros ativos por token | Organização dos especialistas |
|---|---|---|---|
| Mixtral 8x7B | Cerca de 47B | Cerca de 13B | Oito especialistas selecionados por encaminhamento; seleciona dois por camada MoE |
| DeepSeek-V3 | 671B | 37B | 256 especialistas selecionados por encaminhamento mais um partilhado; seleciona oito especialistas encaminhados por camada MoE |
Os números provêm dos artigos sobre Mixtral e DeepSeek-V3. Não significam que só seja necessário armazenar os pesos selecionados para todo o serviço.
Dimensione o armazenamento e a execução separadamente
Com dois bytes por peso, 671 mil milhões de pesos exigem aproximadamente 1,34 TB de armazenamento bruto, antes de contabilizar o estado da cache, os metadados e os buffers do runtime. A quantização pode reduzir este volume de pesos. O particionamento pode distribuí-lo por vários dispositivos; a transferência para outra memória altera os requisitos de transferência de dados. Nada disto está implícito nos 37B de parâmetros ativos.
O encaminhamento também afeta a execução. Um lote pode enviar muitos tokens para um especialista e poucos para outro. O paralelismo de especialistas transfere representações de tokens entre dispositivos, acrescentando comunicação. Um lote maior pode melhorar a utilização das operações matriciais e alterar quais os especialistas que têm de ser executados.
Verifique o checkpoint exato, a precisão, a localização dos especialistas, os kernels suportados, a topologia da rede e o pico de utilização de memória. Meça as fases de prompt e descodificação com uma concorrência realista. Inclua cargas com encaminhamento desigual se ocorrerem no seu tráfego. Use a latência por token e o goodput medidos para avaliar o custo, em vez de tratar os parâmetros ativos como uma fórmula de preço de ponta a ponta.
O guia de engenharia: mistura de especialistas também aborda o equilíbrio do encaminhamento durante o treino.