Jakie metryki monitorować w systemie obsługującym LLM?

Tłumaczenie automatyczne

Ten artykuł został automatycznie przetłumaczony z angielskiego oryginału.

Monitoruj TTFT, TPOT, całkowite opóźnienie, błędy i goodput widoczne dla klienta, a także kolejki serwera, długości w tokenach, wykorzystanie KV cache i wywłaszczenia. Samo wykorzystanie GPU nie pozwala odróżnić użytecznej pracy od przeciążenia. Oceniaj jakość odpowiedzi osobno; szybka usługa nadal może zwracać niepoprawne odpowiedzi.

Zacznij od wyniku widocznego dla użytkownika

TTFT mierzy czas od wysłania żądania do pierwszego tokena wyjściowego. TPOT mierzy średni odstęp między kolejnymi tokenami wyjściowymi. Dla co najmniej dwóch tokenów wyjściowych:

TPOT=last token time−first token timeoutput tokens−1\text{TPOT} = \frac{\text{last token time} - \text{first token time}}{\text{output tokens} - 1}

Mierz te punkty czasowe przy dostarczeniu pierwszego i ostatniego tokena wyjściowego. Osobno zapisuj opóźnienie do zakończenia żądania; końcowe metadane lub porządkowanie połączenia mogą wystąpić po ostatnim tokenie. Zapisuj też poszczególne przerwy w dostarczaniu. Średni TPOT dla żądania może ukryć pauzę. Fragmenty SSE mogą zawierać kilka tokenów, więc odstępy między fragmentami i między tokenami to różne pomiary.

Podawaj percentyle opóźnienia dla istotnych grup obciążenia, na przykład według długości promptu i modelu. Zachowuj spójne granice pomiaru czasu: metryki serwera nie obejmują części czasu sieciowego i przetwarzania po stronie klienta.

Goodput zlicza żądania na sekundę, które spełniają wszystkie zdefiniowane SLO obsługi. Jeśli usługa kończy 100 żądań na sekundę, a 40 nie spełnia przynajmniej jednego wymaganego progu, goodput wynosi 60 żądań na sekundę. Mierzy to wydajność obsługi, a nie poprawność merytoryczną odpowiedzi. DistServe wykorzystuje goodput z ograniczeniami opóźnienia do oceny projektów systemów obsługi.

Dodaj metryki wyjaśniające awarie

Dokumentacja metryk vLLM opisuje żądania wykonywane i oczekujące, histogramy opóźnienia, liczby tokenów, wykorzystanie KV i wywłaszczenia. Dostosuj pulpity monitorowania do wdrożonej wersji.

PomiarCo sprawdzić, gdy wartość rośnie
Oczekujące żądania i czas w kolejceTempo napływu względem dopuszczonej zdolności przetwarzania
Wykorzystanie KV cache i wywłaszczeniaDługie sekwencje, aktywne partie i przydział pamięci
TTFT przy stabilnym TPOTKolejki, tokenizację, przetwarzanie wstępne lub opóźnienie sieci
TPOT i przerwy w dostarczaniuPlanowanie dekodowania, ruch pamięci lub buforowanie po stronie klienta
Tokeny i ponowne próby na ukończone żądanieDłuższe wyjścia lub powtarzaną pracę

Metryka vLLM typu gauge vllm:kv_cache_usage_perc używa ułamka od 0 do 1 mimo swojej nazwy. Wyznacz progi alarmowe na podstawie testów obciążeniowych i wymaganego czasu przywrócenia działania. Powiąż mały zestaw ewaluacji jakości i śladów awarii z metrykami obsługi.

Więcej o ogólnym projekcie znajdziesz w części monitorowanie systemów LLM w przewodniku.