Które parametry sprzętowe GPU mają znaczenie przy obsłudze LLM?

Tłumaczenie automatyczne

Ten artykuł został automatycznie przetłumaczony z angielskiego oryginału.

Przy obsłudze LLM sprawdź pojemność pamięci GPU, przepustowość pamięci, wydajność obliczeń przy planowanej precyzji oraz połączenia między GPU. Pojemność określa, czy w pamięci zmieszczą się wagi i stan żądań. Przepustowość często ogranicza dekodowanie przy małych partiach. Obliczenia i komunikacja mają większe znaczenie wraz ze wzrostem długości promptów, wielkości partii lub skali wykonania rozproszonego.

Sama liczba TFLOPS nie pozwala ustalić, ile żądań serwer może obsłużyć przy akceptowalnym opóźnieniu.

Czytaj parametry wraz z warunkami ich pomiaru

ParametrO co zapytać
Pojemność pamięciCzy zmieszczą się wagi, KV cache, bufory tymczasowe i równoczesne żądania?
Przepustowość pamięciIle bajtów musi odczytać każdy krok dekodowania?
Wydajność Tensor CoresJakiej precyzji, trybu rzadkości i wariantu GPU dotyczy ta liczba?
Przepustowość między GPUCzy chodzi o łączną przepustowość dwukierunkową, czy o przepustowość jednego połączenia?
Przepustowość sieciJaki adapter, liczba portów, topologia i ścieżka przesyłania są dostępne?

HBM to warstwowa pamięć główna używana przez akceleratory w centrach danych. GDDR stosuje się w GPU, w tym w RTX 4090. NVIDIA podaje 3.35 TB/s dla H100 SXM, 4.8 TB/s dla H200 i do 8 TB/s dla B200. Te wartości opisują deklarowaną przepustowość pamięci, a nie zmierzoną szybkość generowania tokenów. Źródła: H100, H200 i parametry komponentów HGX.

Rozróżniaj obliczenia i komunikację

Multiprocesor strumieniowy NVIDIA, czyli SM, zawiera jednostki obliczeniowe ogólnego przeznaczenia, Tensor Cores i lokalne zasoby pamięci. Tensor Cores przyspieszają obsługiwane operacje macierzowe; rdzenie CUDA wykonują inne operacje arytmetyczne. H100 SXM ma 132 SM, a wariant PCIe ma 114. Nawet nazwa produktu wymaga podania wariantu. Tabela architektury Hopper firmy NVIDIA pokazuje tę różnicę.

NVLink łączy obsługiwane GPU w obrębie systemu. InfiniBand łączy maszyny. GPUDirect RDMA pozwala zgodnemu urządzeniu sieciowemu przesyłać dane bezpośrednio do pamięci GPU bez tymczasowego zapisywania ich w pamięci hosta. CPU nadal może zarządzać operacją. Te funkcje mają znaczenie, gdy model jest podzielony między GPU lub jego stan KV jest przenoszony między serwerami.

Zapisz dokładny wariant GPU, pamięć, precyzję, układ serwera i połączenia, zanim porównasz wyniki testu wydajności. Następnie przetestuj długości promptów, długości odpowiedzi i liczbę równoczesnych żądań, które planujesz obsługiwać.

Przewodnik inżynierski: słownik sprzętu GPU definiuje pozostałe terminy sprzętowe używane w dokumentacji obsługi modeli.