¿Qué especificaciones de hardware GPU importan para el serving de LLM?
Traducción automática
Este artículo se tradujo automáticamente a partir de la versión original en inglés.
Para el serving de LLM, compruebe la capacidad de memoria de la GPU, el ancho de banda de memoria, la capacidad de cálculo a la precisión prevista y las interconexiones entre GPU. La capacidad determina si caben los pesos y el estado de las solicitudes. El ancho de banda suele limitar la decodificación con lotes pequeños. El cálculo y la comunicación adquieren más importancia a medida que aumentan los prompts, los lotes o la ejecución distribuida.
Una cifra de TFLOPS por sí sola no permite determinar cuántas solicitudes puede atender un servidor con una latencia aceptable.
Lea las especificaciones junto con sus condiciones
| Especificación | Qué preguntar |
|---|---|
| Capacidad de memoria | ¿Caben los pesos, la KV cache, los búferes temporales y las solicitudes simultáneas? |
| Ancho de banda de memoria | ¿Cuántos bytes debe leer cada paso de decodificación? |
| Rendimiento de Tensor Cores | ¿Qué precisión, modo de esparsidad y variante de GPU se usan para la cifra? |
| Ancho de banda entre GPU | ¿Es el ancho de banda bidireccional agregado o el de una sola conexión? |
| Ancho de banda de red | ¿Qué adaptador, número de puertos, topología y ruta de transferencia hay disponibles? |
HBM es memoria principal apilada que utilizan los aceleradores de centros de datos. GDDR se utiliza en GPU como la RTX 4090. NVIDIA indica 3.35 TB/s para H100 SXM, 4.8 TB/s para H200 y hasta 8 TB/s para B200. Estos valores describen el ancho de banda de memoria anunciado, no el rendimiento medido en tokens. Fuentes: H100, H200 y especificaciones de componentes HGX.
Distinga el cálculo de la comunicación
Un multiprocesador de streaming de NVIDIA, o SM, contiene unidades de cálculo generales, Tensor Cores y recursos de memoria local. Los Tensor Cores aceleran las operaciones matriciales compatibles; los núcleos CUDA se encargan de otras operaciones aritméticas. H100 SXM tiene 132 SM, mientras que la variante PCIe tiene 114. Incluso el nombre del producto requiere especificar la variante. La tabla de arquitectura Hopper de NVIDIA muestra la diferencia.
NVLink conecta las GPU compatibles dentro de un sistema. InfiniBand conecta máquinas. GPUDirect RDMA permite que un dispositivo de red compatible transfiera datos directamente a la memoria de la GPU sin almacenarlos antes en la memoria del host. La CPU puede seguir gestionando la operación. Estas funciones importan cuando un modelo se reparte entre varias GPU o su estado KV se mueve entre servidores.
Anote la variante exacta de GPU, la memoria, la precisión, la disposición del servidor y la interconexión antes de comparar un benchmark. Después, pruebe las longitudes de los prompts, las longitudes de salida y la concurrencia que prevé atender.
La guía de ingeniería: glosario de hardware GPU define los demás términos de hardware utilizados en la documentación de serving.