Welche GPU-Hardwarespezifikationen sind für LLM-Serving wichtig?
Automatische Übersetzung
Dieser Artikel wurde automatisch aus der englischen Originalversion übersetzt.
Prüfen Sie für LLM-Serving die GPU-Speicherkapazität, die Speicherbandbreite, den Compute-Throughput bei der vorgesehenen Präzision und die Verbindungen zwischen GPUs. Die Kapazität bestimmt, ob Weights und der Zustand der Anfragen in den Speicher passen. Die Bandbreite begrenzt häufig Decode bei kleinen Batches. Rechenleistung und Kommunikation werden wichtiger, wenn Prompts, Batches oder die verteilte Ausführung größer werden.
Eine TFLOPS-Angabe allein sagt nicht aus, wie viele Anfragen ein Server bei akzeptabler Latency verarbeiten kann.
Spezifikationen mit ihren Bedingungen lesen
| Spezifikation | Zu klärende Frage |
|---|---|
| Speicherkapazität | Passen Weights, KV cache, temporäre Puffer und gleichzeitige Anfragen in den Speicher? |
| Speicherbandbreite | Wie viele Bytes muss jeder Decode-Schritt lesen? |
| Tensor-Core-Throughput | Für welche Präzision, welchen Sparsity-Modus und welche GPU-Variante gilt die Zahl? |
| Bandbreite zwischen GPUs | Ist die gesamte bidirektionale Bandbreite oder die Bandbreite einer einzelnen Verbindung gemeint? |
| Netzwerkbandbreite | Welche Adapter, Portanzahl, Topologie und Übertragungswege stehen zur Verfügung? |
HBM ist gestapelter Hauptspeicher, den Beschleuniger in Rechenzentren verwenden. GDDR kommt bei GPUs wie der RTX 4090 zum Einsatz. NVIDIA nennt 3.35 TB/s für H100 SXM, 4.8 TB/s für H200 und bis zu 8 TB/s für B200. Diese Werte beschreiben die beworbene Speicherbandbreite, nicht den gemessenen Token-Throughput. Quellen: H100, H200 und HGX-Komponentenspezifikationen.
Berechnung und Kommunikation getrennt betrachten
Ein NVIDIA Streaming Multiprocessor, kurz SM, enthält allgemeine Recheneinheiten, Tensor Cores und lokale Speicherressourcen. Tensor Cores beschleunigen unterstützte Matrixoperationen; CUDA-Kerne übernehmen andere arithmetische Operationen. H100 SXM hat 132 SMs, die PCIe-Variante 114. Selbst der Produktname muss um die Variante ergänzt werden. NVIDIAs Tabelle zur Hopper-Architektur zeigt den Unterschied.
NVLink verbindet unterstützte GPUs innerhalb eines Systems. InfiniBand verbindet Rechner. GPUDirect RDMA ermöglicht einem kompatiblen Netzwerkgerät, Daten direkt in den GPU-Speicher zu übertragen, ohne sie im Hauptspeicher des Hosts zwischenzuspeichern. Die CPU kann den Vorgang weiterhin steuern. Diese Funktionen sind wichtig, wenn ein Model auf mehrere GPUs verteilt wird oder sein KV-Zustand zwischen Servern wechselt.
Halten Sie die genaue GPU-Variante, den Speicher, die Präzision, den Serveraufbau und die Verbindungen fest, bevor Sie einen Benchmark vergleichen. Testen Sie dann die Prompt-Längen, Ausgabelängen und die Anzahl gleichzeitiger Anfragen, die Sie bedienen wollen.
Engineering-Leitfaden: GPU-Hardwareglossar definiert die weiteren Hardwarebegriffe aus der Serving-Dokumentation.