Quelles spécifications matérielles des GPU comptent pour le serving de LLM ?

Traduction automatique

Cet article a été traduit automatiquement depuis la version originale en anglais.

Pour le serving de LLM, vérifiez la capacité mémoire du GPU, la bande passante mémoire, le débit de calcul à la précision prévue et les interconnexions entre GPU. La capacité détermine si les poids et l’état des requêtes tiennent en mémoire. La bande passante limite souvent le décodage avec de petits lots. Le calcul et la communication comptent davantage lorsque la taille des prompts et des lots augmente, ou que l’exécution distribuée prend de l’ampleur.

Un chiffre en TFLOPS ne suffit pas à déterminer combien de requêtes un serveur peut traiter avec une latence acceptable.

Lire les spécifications avec leurs conditions

SpécificationQuestion à poser
Capacité mémoireLes poids, le KV cache, les tampons temporaires et les requêtes simultanées tiennent-ils en mémoire ?
Bande passante mémoireCombien d’octets chaque étape de décodage doit-elle lire ?
Débit des Tensor CoresQuelle précision, quel mode de parcimonie et quelle variante de GPU le chiffre utilise-t-il ?
Bande passante entre GPUS’agit-il de la bande passante bidirectionnelle agrégée ou de celle d’une seule connexion ?
Bande passante réseauQuel adaptateur, combien de ports, quelle topologie et quel chemin de transfert sont disponibles ?

HBM est une mémoire principale empilée utilisée par les accélérateurs de centres de données. GDDR équipe des GPU, dont la RTX 4090. NVIDIA annonce 3.35 TB/s pour H100 SXM, 4.8 TB/s pour H200 et jusqu’à 8 TB/s pour B200. Ces valeurs décrivent la bande passante mémoire annoncée, plutôt que le débit mesuré en tokens. Sources : H100, H200 et spécifications des composants HGX.

Distinguer le calcul de la communication

Un multiprocesseur de streaming NVIDIA, ou SM, contient des unités de calcul générales, des Tensor Cores et des ressources mémoire locales. Les Tensor Cores accélèrent les opérations matricielles prises en charge ; les cœurs CUDA effectuent les autres opérations arithmétiques. H100 SXM possède 132 SM, contre 114 pour la variante PCIe. Même le nom du produit doit préciser la variante. Le tableau de l’architecture Hopper de NVIDIA indique cette différence.

NVLink relie les GPU compatibles au sein d’un système. InfiniBand relie les machines. GPUDirect RDMA permet à un périphérique réseau compatible de transférer des données directement vers la mémoire du GPU sans les stocker temporairement dans la mémoire de l’hôte. Le CPU peut toujours gérer l’opération. Ces fonctions comptent lorsqu’un modèle est réparti entre plusieurs GPU ou que son état KV passe d’un serveur à un autre.

Notez la variante exacte du GPU, la mémoire, la précision, l’agencement du serveur et l’interconnexion avant de comparer un benchmark. Testez ensuite les longueurs de prompts, les longueurs de sortie et le nombre de requêtes simultanées que vous prévoyez de traiter.

Le guide d’ingénierie : glossaire du matériel GPU définit les autres termes matériels utilisés dans la documentation de serving.