MoE: gesamte und aktive Parameter – wie viel Speicher brauchen Sie?

Automatische Übersetzung

Dieser Artikel wurde automatisch aus der englischen Originalversion übersetzt.

Die gesamte Parameterzahl eines MoE umfasst alle Experten und gemeinsam genutzten Model-Komponenten. Aktive Parameter beschreiben die Teilmenge, die für die Berechnung eines Tokens verwendet wird, einschließlich der gemeinsam genutzten Komponenten. Ein Model mit wenigen aktiven Parametern kann trotzdem viel Speicher benötigen, weil unterschiedliche Tokens unterschiedliche Experten auswählen können.

Für Deployment-Ingenieure gilt: Verwenden Sie die gesamten Weights, um den Speicherbedarf abzuschätzen, und die aktive Berechnung, um den Rechenaufwand zu verstehen. Keine der beiden Zahlen allein sagt die Serving-Latency voraus.

Was der Router auswählt

Ein Mixture-of-Experts-Model ersetzt ausgewählte Feed-Forward-Netzwerke durch mehrere Expertennetzwerke. Ein Router wählt für jedes Token eine kleine Anzahl von Experten aus und kombiniert deren Ausgaben. Gemeinsam genutzte Experten werden, sofern vorhanden, für jedes Token ausgeführt. Andere Komponenten, einschließlich Attention, bleiben Teil der aktiven Berechnung.

Experten sind nicht unbedingt kleiner als das Feed-Forward-Netzwerk in einem vergleichbaren dichten Model. Nicht jede Schicht muss Experten verwenden: DeepSeek-V3 behält seine ersten drei Schichten als dichte Schichten bei.

ModelGesamte ParameterAktive Parameter pro TokenAnordnung der Experten
Mixtral 8x7BEtwa 47BEtwa 13BAcht durch Routing ausgewählte Experten; wählt zwei pro MoE-Schicht aus
DeepSeek-V3671B37B256 durch Routing ausgewählte Experten plus ein gemeinsam genutzter Experte; wählt acht Routing-Experten pro MoE-Schicht aus

Die Zahlen stammen aus den Veröffentlichungen zu Mixtral und DeepSeek-V3. Sie bedeuten nicht, dass für den gesamten Dienst nur die ausgewählten Weights gespeichert werden müssen.

Speicher und Ausführung getrennt dimensionieren

Bei zwei Bytes pro Weight benötigen 671 Milliarden Weights ungefähr 1,34 TB reinen Speicherplatz, noch ohne Cache-Zustand, Metadaten und Runtime-Puffer. Quantization kann die Datenmenge der Weights reduzieren. Sharding kann sie auf mehrere Geräte verteilen; Offloading verändert die Anforderungen an den Datentransfer. Nichts davon ergibt sich aus der Zahl von 37B aktiven Parametern.

Routing beeinflusst auch die Runtime. Ein Batch kann viele Tokens an einen Experten und wenige an einen anderen senden. Expertenparallelität überträgt Token-Repräsentationen zwischen Geräten und verursacht dadurch zusätzliche Kommunikation. Ein größerer Batch kann die Auslastung der Matrixoperationen verbessern und zugleich verändern, welche Experten ausgeführt werden müssen.

Prüfen Sie den genauen Checkpoint, die Präzision, die Platzierung der Experten, die unterstützten Kernels, die Netzwerktopologie und den maximalen Speicherbedarf. Messen Sie die Prompt- und Decode-Phasen bei realistischer Parallelität. Berücksichtigen Sie Workloads mit ungleichmäßigem Routing, falls diese in Ihrem Traffic vorkommen. Beurteilen Sie die Kosten anhand gemessener Token-Latency und goodput, statt aktive Parameter als Preisformel für den gesamten Ablauf zu behandeln.

Der Engineering-Leitfaden: Mixture of Experts behandelt auch die Routing-Balance während des Trainings.