Cómo medir la latencia de un LLM con TTFT, TPOT y P99
Traducción automática
Este artículo se tradujo automáticamente a partir de la versión original en inglés.
El tiempo hasta el primer token, o TTFT, mide cuánto espera una solicitud hasta recibir su primer token generado. El tiempo por token de salida, o TPOT, mide el intervalo medio entre los tokens posteriores. Mide ambos: un servidor puede empezar rápido y generar despacio, o hacer esperar a los usuarios antes de transmitir rápidamente la respuesta.
Al comparar servidores, los ingenieros deben usar los mismos puntos de inicio y fin de medición e informar de la latencia según la longitud del prompt, la longitud de la salida y la carga.
Calcula cada solicitud por separado
Registra el instante de envío de la solicitud, el del primer token generado, el del último token generado y el número de tokens de salida. Para una respuesta con al menos dos tokens:
TTFT = first_token_time - request_start_time
TPOT = (last_token_time - first_token_time) / (output_tokens - 1)
Si la solicitud se envía a los 0 segundos, el primer token llega a los 0.3 segundos y el vigésimo a los 1.25 segundos, el TTFT es de 300 ms y el TPOT medio es de 50 ms. El TPOT no está definido para una respuesta de un solo token.
El TTFT observado por el cliente puede incluir la comunicación de red, la espera en cola, la tokenización y el prefill. Una medición de prefill en el servidor excluye varios de esos tiempos. Identifica ambas mediciones en lugar de compararlas como si fueran equivalentes. La pasada de prefill suele proporcionar los logits usados para generar el primer token; consulta la descripción de las fases de inferencia de Splitwise.
Examina la distribución de latencia
P50 es la mediana de la latencia de las solicitudes. P99 es el valor por debajo del cual se sitúa el 99% de las solicitudes medidas. Calcula los percentiles a partir de las mediciones de cada solicitud. Promediar todos los intervalos entre tokens de todas las solicitudes da más peso a las respuestas largas y responde a una pregunta distinta.
El TPOT medio también oculta las pausas entre determinados tokens. Registra los intervalos individuales entre tokens al diagnosticar interrupciones de la transmisión. Un fragmento HTTP puede contener varios tokens, por lo que los intervalos entre la llegada de fragmentos no reflejan exactamente los tiempos de generación de tokens.
Como referencia histórica, MLPerf Inference v5.0 especificaba un TTFT P99 de 450 ms y un TPOT P99 de 40 ms para su benchmark interactivo de Llama 2 Chat 70B. Esos límites definen ese benchmark. Elige los objetivos de tu producto mediante pruebas con usuarios y después indica con qué carga ofrecida los cumple el servidor.
La guía de ingeniería: TTFT, TPOT y percentiles relaciona estas mediciones con las colas y las fases de inferencia.