MoE: parámetros totales y activos, ¿cuánta memoria necesitas?
Traducción automática
Este artículo se tradujo automáticamente a partir de la versión original en inglés.
El número total de parámetros de MoE incluye todos los expertos y los componentes compartidos del modelo. Los parámetros activos describen el subconjunto utilizado para calcular un token, incluidos los componentes compartidos. Un modelo con pocos parámetros activos puede seguir necesitando mucha memoria, porque distintos tokens pueden seleccionar distintos expertos.
Para los ingenieros de despliegue: usa todos los pesos para estimar el almacenamiento y el cálculo activo para entender las operaciones aritméticas. Ninguna de las dos cifras por sí sola predice la latencia del serving.
Qué selecciona el enrutador
Un modelo de mezcla de expertos sustituye determinadas redes de propagación hacia delante por varias redes de expertos. Un enrutador elige un pequeño número de expertos para cada token y combina sus salidas. Los expertos compartidos, cuando existen, se ejecutan para cada token. Otros componentes, incluida la atención, siguen formando parte del cálculo activo.
Los expertos no son necesariamente más pequeños que la red de propagación hacia delante de un modelo denso comparable. No todas las capas tienen que usar expertos: DeepSeek-V3 mantiene densas sus tres primeras capas.
| Modelo | Parámetros totales | Parámetros activos por token | Organización de los expertos |
|---|---|---|---|
| Mixtral 8x7B | Unos 47B | Unos 13B | Ocho expertos seleccionados por enrutamiento; selecciona dos por capa MoE |
| DeepSeek-V3 | 671B | 37B | 256 expertos seleccionados por enrutamiento más uno compartido; selecciona ocho expertos enrutados por capa MoE |
Las cifras proceden de los artículos de Mixtral y DeepSeek-V3. No significan que solo haya que almacenar los pesos seleccionados para todo el servicio.
Dimensiona el almacenamiento y la ejecución por separado
Con dos bytes por peso, 671 mil millones de pesos requieren aproximadamente 1,34 TB de almacenamiento bruto, sin contar el estado de la caché, los metadatos ni los búferes del runtime. La cuantización puede reducir el volumen de los pesos. La partición puede distribuirlo entre dispositivos; la descarga a otra memoria cambia los requisitos de transferencia de datos. Nada de esto se deduce de los 37B de parámetros activos.
El enrutamiento también afecta a la ejecución. Un lote puede enviar muchos tokens a un experto y pocos a otro. El paralelismo de expertos transfiere representaciones de tokens entre dispositivos, lo que añade comunicación. Un lote más grande puede mejorar el aprovechamiento de las operaciones matriciales y cambiar qué expertos deben ejecutarse.
Comprueba el checkpoint exacto, la precisión, la ubicación de los expertos, los kernels compatibles, la topología de red y el uso máximo de memoria. Mide las fases de prompt y decodificación con una concurrencia realista. Incluye cargas con enrutamiento desigual si aparecen en tu tráfico. Usa la latencia por token y el goodput medidos para evaluar el coste, en lugar de tratar los parámetros activos como una fórmula de precio de extremo a extremo.
La guía de ingeniería: mezcla de expertos también aborda el equilibrio del enrutamiento durante el entrenamiento.