Que especificações de hardware GPU importam para o serving de LLM?

Tradução automática

Este artigo foi traduzido automaticamente a partir da versão original em inglês.

Para o serving de LLM, verifique a capacidade de memória da GPU, a largura de banda da memória, a capacidade de cálculo na precisão pretendida e as interligações entre GPU. A capacidade determina se os pesos e o estado dos pedidos cabem na memória. A largura de banda limita frequentemente a descodificação com lotes pequenos. O cálculo e a comunicação ganham importância à medida que aumentam os prompts, os lotes ou a execução distribuída.

Um valor em TFLOPS, por si só, não permite determinar quantos pedidos um servidor consegue tratar com uma latência aceitável.

Leia as especificações juntamente com as respetivas condições

EspecificaçãoO que perguntar
Capacidade de memóriaOs pesos, a KV cache, os buffers temporários e os pedidos simultâneos cabem na memória?
Largura de banda da memóriaQuantos bytes tem cada passo de descodificação de ler?
Débito dos Tensor CoresA que precisão, modo de esparsidade e variante de GPU se refere o valor?
Largura de banda entre GPUÉ a largura de banda bidirecional agregada ou a de uma única ligação?
Largura de banda da redeQue adaptador, número de portas, topologia e percurso de transferência estão disponíveis?

HBM é memória principal empilhada utilizada pelos aceleradores dos centros de dados. GDDR é utilizada em GPU, incluindo a RTX 4090. A NVIDIA indica 3.35 TB/s para H100 SXM, 4.8 TB/s para H200 e até 8 TB/s para B200. Estes valores descrevem a largura de banda da memória anunciada, e não o débito medido em tokens. Fontes: H100, H200 e especificações dos componentes HGX.

Distinga o cálculo da comunicação

Um multiprocessador de streaming da NVIDIA, ou SM, contém unidades de cálculo de uso geral, Tensor Cores e recursos de memória local. Os Tensor Cores aceleram as operações matriciais suportadas; os núcleos CUDA tratam de outras operações aritméticas. H100 SXM tem 132 SM, enquanto a variante PCIe tem 114. Mesmo o nome do produto exige que se indique a variante. A tabela da arquitetura Hopper da NVIDIA apresenta a diferença.

NVLink liga as GPU suportadas dentro de um sistema. InfiniBand liga máquinas. GPUDirect RDMA permite que um dispositivo de rede compatível transfira dados diretamente para a memória da GPU sem os guardar temporariamente na memória do anfitrião. A CPU pode continuar a gerir a operação. Estas funcionalidades importam quando um modelo é dividido entre GPU ou o seu estado KV é transferido entre servidores.

Registe a variante exata da GPU, a memória, a precisão, a disposição do servidor e a interligação antes de comparar um benchmark. Depois, teste os comprimentos dos prompts, os comprimentos das respostas e a quantidade de pedidos simultâneos que pretende servir.

O guia de engenharia: glossário de hardware GPU define os restantes termos de hardware utilizados na documentação de serving.