Какие характеристики GPU важны для сервинга LLM?
Автоматический перевод
Эта статья была автоматически переведена с оригинальной английской версии.
Для сервинга LLM проверяйте объём памяти GPU, пропускную способность памяти, вычислительную производительность при выбранной точности и соединения между GPU. Объём памяти определяет, поместятся ли в ней веса и состояние запросов. Пропускная способность часто ограничивает декодирование с небольшими батчами. Вычисления и обмен данными становятся важнее по мере увеличения промптов, батчей или масштаба распределённого выполнения.
Одно число TFLOPS не определяет, сколько запросов сервер может обработать с приемлемой латентностью.
Читайте характеристики вместе с условиями
| Характеристика | Что выяснить |
|---|---|
| Объём памяти | Поместятся ли веса, KV cache, временные буферы и одновременные запросы? |
| Пропускная способность памяти | Сколько байтов нужно прочитать на каждом шаге декодирования? |
| Производительность Tensor Cores | Для какой точности, режима разреженности и варианта GPU указано число? |
| Пропускная способность соединений между GPU | Это суммарная двунаправленная пропускная способность или пропускная способность одного соединения? |
| Пропускная способность сети | Какие адаптер, число портов, топология и путь передачи доступны? |
HBM — это многослойная основная память, которую используют ускорители в дата-центрах. GDDR используется в GPU, включая RTX 4090. NVIDIA указывает 3.35 TB/s для H100 SXM, 4.8 TB/s для H200 и до 8 TB/s для B200. Эти значения описывают заявленную пропускную способность памяти, а не измеренный throughput в токенах. Источники: H100, H200 и характеристики компонентов HGX.
Разделяйте вычисления и обмен данными
Потоковый мультипроцессор NVIDIA, или SM, содержит вычислительные блоки общего назначения, Tensor Cores и локальные ресурсы памяти. Tensor Cores ускоряют поддерживаемые матричные операции; ядра CUDA выполняют другие арифметические операции. У H100 SXM 132 SM, а у варианта PCIe — 114. Даже название продукта требует уточнения варианта. Различие указано в таблице архитектуры Hopper от NVIDIA.
NVLink соединяет поддерживаемые GPU внутри системы. InfiniBand соединяет машины. GPUDirect RDMA позволяет совместимому сетевому устройству передавать данные прямо в память GPU без промежуточного размещения в памяти хоста. CPU по-прежнему может управлять операцией. Эти возможности важны, когда модель разделена между GPU или её состояние KV перемещается между серверами.
Перед сравнением результатов бенчмарка запишите точный вариант GPU, память, точность, конфигурацию сервера и соединения. Затем протестируйте длины промптов, длины ответов и число одновременных запросов, которые планируете обслуживать.
Инженерное руководство: глоссарий аппаратных характеристик GPU определяет дополнительные аппаратные термины из документации по сервингу.