Que especificações de hardware GPU importam para o serving de LLM?
Tradução automática
Este artigo foi traduzido automaticamente a partir da versão original em inglês.
Para o serving de LLM, verifique a capacidade de memória da GPU, a largura de banda da memória, a capacidade de cálculo na precisão pretendida e as interligações entre GPU. A capacidade determina se os pesos e o estado dos pedidos cabem na memória. A largura de banda limita frequentemente a descodificação com lotes pequenos. O cálculo e a comunicação ganham importância à medida que aumentam os prompts, os lotes ou a execução distribuída.
Um valor em TFLOPS, por si só, não permite determinar quantos pedidos um servidor consegue tratar com uma latência aceitável.
Leia as especificações juntamente com as respetivas condições
| Especificação | O que perguntar |
|---|---|
| Capacidade de memória | Os pesos, a KV cache, os buffers temporários e os pedidos simultâneos cabem na memória? |
| Largura de banda da memória | Quantos bytes tem cada passo de descodificação de ler? |
| Débito dos Tensor Cores | A que precisão, modo de esparsidade e variante de GPU se refere o valor? |
| Largura de banda entre GPU | É a largura de banda bidirecional agregada ou a de uma única ligação? |
| Largura de banda da rede | Que adaptador, número de portas, topologia e percurso de transferência estão disponíveis? |
HBM é memória principal empilhada utilizada pelos aceleradores dos centros de dados. GDDR é utilizada em GPU, incluindo a RTX 4090. A NVIDIA indica 3.35 TB/s para H100 SXM, 4.8 TB/s para H200 e até 8 TB/s para B200. Estes valores descrevem a largura de banda da memória anunciada, e não o débito medido em tokens. Fontes: H100, H200 e especificações dos componentes HGX.
Distinga o cálculo da comunicação
Um multiprocessador de streaming da NVIDIA, ou SM, contém unidades de cálculo de uso geral, Tensor Cores e recursos de memória local. Os Tensor Cores aceleram as operações matriciais suportadas; os núcleos CUDA tratam de outras operações aritméticas. H100 SXM tem 132 SM, enquanto a variante PCIe tem 114. Mesmo o nome do produto exige que se indique a variante. A tabela da arquitetura Hopper da NVIDIA apresenta a diferença.
NVLink liga as GPU suportadas dentro de um sistema. InfiniBand liga máquinas. GPUDirect RDMA permite que um dispositivo de rede compatível transfira dados diretamente para a memória da GPU sem os guardar temporariamente na memória do anfitrião. A CPU pode continuar a gerir a operação. Estas funcionalidades importam quando um modelo é dividido entre GPU ou o seu estado KV é transferido entre servidores.
Registe a variante exata da GPU, a memória, a precisão, a disposição do servidor e a interligação antes de comparar um benchmark. Depois, teste os comprimentos dos prompts, os comprimentos das respostas e a quantidade de pedidos simultâneos que pretende servir.
O guia de engenharia: glossário de hardware GPU define os restantes termos de hardware utilizados na documentação de serving.