MoE : paramètres totaux et actifs, de combien de mémoire avez-vous besoin ?

Traduction automatique

Cet article a été traduit automatiquement depuis la version originale en anglais.

Le nombre total de paramètres d’un MoE inclut tous les experts et les composants partagés du modèle. Les paramètres actifs désignent le sous-ensemble utilisé pour le calcul d’un token, y compris les composants partagés. Un modèle ayant peu de paramètres actifs peut tout de même nécessiter beaucoup de mémoire, car différents tokens peuvent sélectionner différents experts.

Pour les ingénieurs chargés du déploiement : utilisez l’ensemble des poids pour estimer le stockage et le calcul actif pour comprendre les opérations arithmétiques. Aucun de ces deux nombres ne suffit à prédire la latence du serving.

Ce que sélectionne le routeur

Un modèle à mélange d’experts remplace certains réseaux à propagation avant par plusieurs réseaux d’experts. Un routeur choisit un petit nombre d’experts pour chaque token et combine leurs sorties. Les experts partagés, lorsqu’ils existent, s’exécutent pour chaque token. Les autres composants, dont l’attention, restent dans le calcul actif.

Les experts ne sont pas nécessairement plus petits que le réseau à propagation avant d’un modèle dense comparable. Toutes les couches ne doivent pas forcément utiliser des experts : DeepSeek-V3 conserve ses trois premières couches denses.

ModèleParamètres totauxParamètres actifs par tokenOrganisation des experts
Mixtral 8x7BEnviron 47BEnviron 13BHuit experts sélectionnés par routage ; en sélectionne deux par couche MoE
DeepSeek-V3671B37B256 experts sélectionnés par routage plus un expert partagé ; sélectionne huit experts routés par couche MoE

Ces nombres proviennent des articles sur Mixtral et DeepSeek-V3. Ils ne signifient pas que seuls les poids sélectionnés doivent être stockés pour l’ensemble du service.

Dimensionner séparément le stockage et l’exécution

À deux octets par poids, 671 milliards de poids nécessitent environ 1,34 TB de stockage brut, avant de compter l’état du cache, les métadonnées et les tampons du runtime. La quantification peut réduire ce volume de poids. Le partitionnement peut le répartir entre les appareils ; le déchargement vers une autre mémoire modifie les besoins de transfert de données. Rien de cela ne découle des 37B de paramètres actifs.

Le routage affecte aussi l’exécution. Un lot peut envoyer de nombreux tokens à un expert et peu à un autre. Le parallélisme des experts transfère les représentations des tokens entre les appareils, ce qui ajoute de la communication. Un lot plus grand peut améliorer l’utilisation des opérations matricielles tout en modifiant les experts qui doivent s’exécuter.

Vérifiez le checkpoint exact, la précision, le placement des experts, les noyaux pris en charge, la topologie réseau et le pic d’utilisation mémoire. Mesurez les phases de prompt et de décodage avec une concurrence réaliste. Incluez des charges présentant un routage déséquilibré si elles existent dans votre trafic. Évaluez le coût à partir de la latence par token et du goodput mesurés, plutôt que de considérer les paramètres actifs comme une formule de prix de bout en bout.

Le guide d’ingénierie : mélange d’experts traite aussi de l’équilibrage du routage pendant l’entraînement.