Que métricas deve monitorizar num sistema de serving de LLM?
Tradução automática
Este artigo foi traduzido automaticamente a partir da versão original em inglês.
Monitorize TTFT, TPOT, latência total, erros e goodput visíveis para o cliente, juntamente com as filas do servidor, os comprimentos em tokens, a utilização de KV cache e as preempções. A utilização de GPU, por si só, não distingue trabalho útil de sobrecarga. Avalie a qualidade das respostas separadamente; um serviço rápido pode ainda devolver respostas incorretas.
Comece pelo resultado visível para o utilizador
TTFT mede o tempo desde o envio do pedido até ao primeiro token de saída. TPOT mede o intervalo médio entre os tokens de saída seguintes. Para pelo menos dois tokens de saída:
Meça estes instantes na entrega do primeiro e do último token de saída. Registe separadamente a latência até à conclusão do pedido; os metadados finais ou a limpeza da ligação podem ocorrer depois do último token. Registe também as interrupções individuais na entrega. O TPOT médio de um pedido pode ocultar uma pausa. Os fragmentos SSE podem conter vários tokens, pelo que os intervalos entre fragmentos e entre tokens são medições diferentes.
Apresente os percentis de latência por grupos de carga de trabalho relevantes, como o comprimento do prompt e o modelo. Mantenha limites de medição de tempo consistentes: as métricas do servidor excluem parte do tempo de rede e do processamento no cliente.
Goodput conta os pedidos por segundo que cumprem todos os SLO de serving definidos. Se o serviço concluir 100 pedidos por segundo e 40 não cumprirem pelo menos um limite obrigatório, o goodput é de 60 pedidos por segundo. Isto mede o desempenho do serving, não a correção factual das respostas. DistServe utiliza goodput sujeito a restrições de latência para avaliar arquiteturas de serving.
Acrescente as métricas que explicam as falhas
A documentação de métricas do vLLM descreve os pedidos em execução e em espera, os histogramas de latência, as contagens de tokens, a utilização de KV e as preempções. Adapte os painéis à versão implementada.
| Medição | O que investigar quando aumenta |
|---|---|
| Pedidos em espera e tempo na fila | Taxa de chegada face à capacidade de processamento admitida |
| Utilização de KV cache e preempções | Sequências longas, lotes ativos e atribuição de memória |
| TTFT com TPOT estável | Filas, tokenização, prefill ou atraso de rede |
| TPOT e interrupções na entrega | Escalonamento da descodificação, tráfego de memória ou armazenamento temporário no cliente |
| Tokens e novas tentativas por pedido concluído | Saídas mais longas ou trabalho repetido |
A métrica de tipo gauge do vLLM vllm:kv_cache_usage_perc utiliza uma fração de 0 a 1, apesar do nome. Derive os limites de alerta dos testes de carga e do tempo de recuperação exigido. Mantenha um pequeno conjunto de avaliações de qualidade e registos de execução de falhas associados às métricas de serving.
Para conhecer a conceção geral, leia monitorização de sistemas LLM no guia.