Welke GPU-hardwarespecificaties zijn belangrijk voor LLM-serving?

Automatische vertaling

Dit artikel is automatisch vertaald vanuit de oorspronkelijke Engelse versie.

Controleer voor LLM-serving de GPU-geheugencapaciteit, de geheugenbandbreedte, de throughput voor berekeningen bij de beoogde precisie en de interconnects tussen GPUs. De capaciteit bepaalt of weights en de toestand van verzoeken in het geheugen passen. Bandbreedte beperkt vaak decode bij kleine batches. Rekenkracht en communicatie worden belangrijker naarmate prompts, batches of gedistribueerde uitvoering toenemen.

Een TFLOPS-cijfer alleen kan niet bepalen hoeveel verzoeken een server bij een aanvaardbare latency kan verwerken.

Lees specificaties samen met hun voorwaarden

SpecificatieWat je moet vragen
GeheugencapaciteitPassen weights, KV cache, tijdelijke buffers en gelijktijdige verzoeken in het geheugen?
GeheugenbandbreedteHoeveel bytes moet elke decode-stap lezen?
Throughput van Tensor CoresVoor welke precisie, sparsitymodus en GPU-variant geldt het cijfer?
Bandbreedte tussen GPUsGaat het om de totale bidirectionele bandbreedte of die van één verbinding?
NetwerkbandbreedteWelke adapter, welk aantal poorten, welke topologie en welk overdrachtspad zijn beschikbaar?

HBM is gestapeld hoofdgeheugen dat datacenteraccelerators gebruiken. GDDR wordt gebruikt door GPUs, waaronder de RTX 4090. NVIDIA vermeldt 3.35 TB/s voor H100 SXM, 4.8 TB/s voor H200 en tot 8 TB/s voor B200. Deze waarden beschrijven de geadverteerde geheugenbandbreedte, niet de gemeten throughput in tokens. Bronnen: H100, H200 en HGX-componentspecificaties.

Maak onderscheid tussen berekening en communicatie

Een NVIDIA streaming multiprocessor, of SM, bevat algemene rekeneenheden, Tensor Cores en lokale geheugenvoorzieningen. Tensor Cores versnellen ondersteunde matrixbewerkingen; CUDA-cores voeren andere rekenkundige bewerkingen uit. H100 SXM heeft 132 SMs, terwijl de PCIe-variant er 114 heeft. Zelfs bij de productnaam moet je de variant vermelden. NVIDIA’s tabel van de Hopper-architectuur toont het verschil.

NVLink verbindt ondersteunde GPUs binnen een systeem. InfiniBand verbindt machines. GPUDirect RDMA stelt een compatibel netwerkapparaat in staat gegevens rechtstreeks naar GPU-geheugen over te dragen zonder ze tijdelijk in het hostgeheugen op te slaan. De CPU kan de bewerking nog steeds beheren. Deze functies zijn belangrijk wanneer een model over GPUs wordt verdeeld of de KV-toestand ervan tussen servers wordt verplaatst.

Leg de exacte GPU-variant, het geheugen, de precisie, de serverindeling en de interconnect vast voordat je een benchmark vergelijkt. Test daarna de promptlengtes, uitvoerlengtes en het aantal gelijktijdige verzoeken dat je wilt verwerken.

De engineeringgids: woordenlijst voor GPU-hardware definieert de overige hardwaretermen die in servingdocumentatie worden gebruikt.