Jakie metryki monitorować w systemie obsługującym LLM?
Tłumaczenie automatyczne
Ten artykuł został automatycznie przetłumaczony z angielskiego oryginału.
Monitoruj TTFT, TPOT, całkowite opóźnienie, błędy i goodput widoczne dla klienta, a także kolejki serwera, długości w tokenach, wykorzystanie KV cache i wywłaszczenia. Samo wykorzystanie GPU nie pozwala odróżnić użytecznej pracy od przeciążenia. Oceniaj jakość odpowiedzi osobno; szybka usługa nadal może zwracać niepoprawne odpowiedzi.
Zacznij od wyniku widocznego dla użytkownika
TTFT mierzy czas od wysłania żądania do pierwszego tokena wyjściowego. TPOT mierzy średni odstęp między kolejnymi tokenami wyjściowymi. Dla co najmniej dwóch tokenów wyjściowych:
Mierz te punkty czasowe przy dostarczeniu pierwszego i ostatniego tokena wyjściowego. Osobno zapisuj opóźnienie do zakończenia żądania; końcowe metadane lub porządkowanie połączenia mogą wystąpić po ostatnim tokenie. Zapisuj też poszczególne przerwy w dostarczaniu. Średni TPOT dla żądania może ukryć pauzę. Fragmenty SSE mogą zawierać kilka tokenów, więc odstępy między fragmentami i między tokenami to różne pomiary.
Podawaj percentyle opóźnienia dla istotnych grup obciążenia, na przykład według długości promptu i modelu. Zachowuj spójne granice pomiaru czasu: metryki serwera nie obejmują części czasu sieciowego i przetwarzania po stronie klienta.
Goodput zlicza żądania na sekundę, które spełniają wszystkie zdefiniowane SLO obsługi. Jeśli usługa kończy 100 żądań na sekundę, a 40 nie spełnia przynajmniej jednego wymaganego progu, goodput wynosi 60 żądań na sekundę. Mierzy to wydajność obsługi, a nie poprawność merytoryczną odpowiedzi. DistServe wykorzystuje goodput z ograniczeniami opóźnienia do oceny projektów systemów obsługi.
Dodaj metryki wyjaśniające awarie
Dokumentacja metryk vLLM opisuje żądania wykonywane i oczekujące, histogramy opóźnienia, liczby tokenów, wykorzystanie KV i wywłaszczenia. Dostosuj pulpity monitorowania do wdrożonej wersji.
| Pomiar | Co sprawdzić, gdy wartość rośnie |
|---|---|
| Oczekujące żądania i czas w kolejce | Tempo napływu względem dopuszczonej zdolności przetwarzania |
| Wykorzystanie KV cache i wywłaszczenia | Długie sekwencje, aktywne partie i przydział pamięci |
| TTFT przy stabilnym TPOT | Kolejki, tokenizację, przetwarzanie wstępne lub opóźnienie sieci |
| TPOT i przerwy w dostarczaniu | Planowanie dekodowania, ruch pamięci lub buforowanie po stronie klienta |
| Tokeny i ponowne próby na ukończone żądanie | Dłuższe wyjścia lub powtarzaną pracę |
Metryka vLLM typu gauge vllm:kv_cache_usage_perc używa ułamka od 0 do 1 mimo swojej nazwy. Wyznacz progi alarmowe na podstawie testów obciążeniowych i wymaganego czasu przywrócenia działania. Powiąż mały zestaw ewaluacji jakości i śladów awarii z metrykami obsługi.
Więcej o ogólnym projekcie znajdziesz w części monitorowanie systemów LLM w przewodniku.