GPU-Auswahl für LLMs: Wie viel GPU-Speicher brauche ich?
Automatische Übersetzung
Dieser Artikel wurde automatisch aus der englischen Originalversion übersetzt.
Schätzen Sie den Speicherbedarf für Weights, KV cache und Runtime, bevor Sie die GPU-Geschwindigkeit vergleichen. Messen Sie anschließend Bandbreite, Rechenleistung und Verbindungen zwischen GPUs mit der vorgesehenen Verteilung der Anfragen. Ein Model, dessen Weights in den Speicher passen, kann die Speicherkapazität trotzdem überschreiten, wenn mehrere lange Anfragen gleichzeitig laufen.
Berücksichtigen Sie bei der Speicherberechnung die erforderliche Anzahl gleichzeitiger Anfragen und die Sequenzlängen.
Den Speicherbedarf schätzen
Ein Model mit 7 Milliarden Parametern benötigt in FP16 etwa 14 GB für die reinen Weight-Werte. INT4 reduziert diese Werte auf etwa 3.5 GB, doch Skalierungsfaktoren, nicht quantisierte Tensoren und Runtime-Allokationen benötigen zusätzlichen Speicher. Entscheidend ist die tatsächliche Speicherbelegung des Artefakts.
Schätzen Sie als Nächstes den Speicherbedarf des KV cache anhand der Architektur, der Cache-Präzision, der aktiven Sequenzlängen und der Batch-Größe. Berücksichtigen Sie abschließend temporäre Activations, Puffer, den Overhead des Speicherallokators und eine anhand von Messungen festgelegte Reserve.
In einem einfachen Planungsbeispiel benötigen 14 GB Weights plus eine gemessene KV-Allokation von 4 GB bereits 18 GB, bevor weitere Allokationen hinzukommen. Auf einer Karte mit 24 GB bleibt damit wenig Spielraum, wenn Runtime-Overhead oder längere Anfragen den Rest verbrauchen. Daraus folgt nicht, dass jedes Model mit 7 Milliarden Parametern einen Cache von 4 GB hat.
Bandbreite und GPU-Verbindungen verändern den Vergleich
| GPU-Variante | Angegebener Speicher | Angegebene Speicherbandbreite |
|---|---|---|
| H100 SXM | 80 GB HBM3 | 3.35 TB/s |
| H200 SXM | 141 GB HBM3e | 4.8 TB/s |
| B200 SXM | 180 GB HBM3e | Bis zu 8 TB/s |
Diese Werte stammen aus NVIDIAs HGX-Referenzarchitektur. Sie beschreiben bestimmte Varianten und sind keine austauschbaren Spezifikationen für alle Karten mit demselben Familiennamen.
Bei Decode mit kleinen Batches kann das Lesen von Weights und Attention-Zustand dazu führen, dass die Speicherbandbreite wichtiger ist als die maximale Matrix-Rechenleistung. Größere Batches, lange Prefills und optimierte Kernels können verändern, welche Ressource die Leistung begrenzt. Wenn ein Model mehrere GPUs benötigt, berücksichtigen Sie die Zeit für kollektive Kommunikation und die verfügbaren Verbindungen zwischen den Geräten.
Vergleichen Sie die tatsächlichen Kosten pro erfolgreicher Anfrage bei gleicher Zielqualität und Ziel-Latency. Berücksichtigen Sie die erforderlichen GPU-Gruppen und ungenutzte Kapazität; der aktuelle Mietpreis allein zeigt nicht die Serving-Effizienz.
Der Abschnitt zur GPU-Auswahl im LLM Engineering Guide vergleicht weitere Geräte. Nutzen Sie die Speicherplanung für den KV cache, um die variable Speicherbelegung zu schätzen.