Que métricas deve monitorizar num sistema de serving de LLM?

Tradução automática

Este artigo foi traduzido automaticamente a partir da versão original em inglês.

Monitorize TTFT, TPOT, latência total, erros e goodput visíveis para o cliente, juntamente com as filas do servidor, os comprimentos em tokens, a utilização de KV cache e as preempções. A utilização de GPU, por si só, não distingue trabalho útil de sobrecarga. Avalie a qualidade das respostas separadamente; um serviço rápido pode ainda devolver respostas incorretas.

Comece pelo resultado visível para o utilizador

TTFT mede o tempo desde o envio do pedido até ao primeiro token de saída. TPOT mede o intervalo médio entre os tokens de saída seguintes. Para pelo menos dois tokens de saída:

TPOT=last token time−first token timeoutput tokens−1\text{TPOT} = \frac{\text{last token time} - \text{first token time}}{\text{output tokens} - 1}

Meça estes instantes na entrega do primeiro e do último token de saída. Registe separadamente a latência até à conclusão do pedido; os metadados finais ou a limpeza da ligação podem ocorrer depois do último token. Registe também as interrupções individuais na entrega. O TPOT médio de um pedido pode ocultar uma pausa. Os fragmentos SSE podem conter vários tokens, pelo que os intervalos entre fragmentos e entre tokens são medições diferentes.

Apresente os percentis de latência por grupos de carga de trabalho relevantes, como o comprimento do prompt e o modelo. Mantenha limites de medição de tempo consistentes: as métricas do servidor excluem parte do tempo de rede e do processamento no cliente.

Goodput conta os pedidos por segundo que cumprem todos os SLO de serving definidos. Se o serviço concluir 100 pedidos por segundo e 40 não cumprirem pelo menos um limite obrigatório, o goodput é de 60 pedidos por segundo. Isto mede o desempenho do serving, não a correção factual das respostas. DistServe utiliza goodput sujeito a restrições de latência para avaliar arquiteturas de serving.

Acrescente as métricas que explicam as falhas

A documentação de métricas do vLLM descreve os pedidos em execução e em espera, os histogramas de latência, as contagens de tokens, a utilização de KV e as preempções. Adapte os painéis à versão implementada.

MediçãoO que investigar quando aumenta
Pedidos em espera e tempo na filaTaxa de chegada face à capacidade de processamento admitida
Utilização de KV cache e preempçõesSequências longas, lotes ativos e atribuição de memória
TTFT com TPOT estávelFilas, tokenização, prefill ou atraso de rede
TPOT e interrupções na entregaEscalonamento da descodificação, tráfego de memória ou armazenamento temporário no cliente
Tokens e novas tentativas por pedido concluídoSaídas mais longas ou trabalho repetido

A métrica de tipo gauge do vLLM vllm:kv_cache_usage_perc utiliza uma fração de 0 a 1, apesar do nome. Derive os limites de alerta dos testes de carga e do tempo de recuperação exigido. Mantenha um pequeno conjunto de avaliações de qualidade e registos de execução de falhas associados às métricas de serving.

Para conhecer a conceção geral, leia monitorização de sistemas LLM no guia.