¿Cuándo acelera la decodificación especulativa el serving de LLM?

Traducción automática

Este artículo se tradujo automáticamente a partir de la versión original en inglés.

La decodificación especulativa puede acelerar la generación cuando proponer varios tokens candidatos cuesta poco y el modelo objetivo acepta suficientes. El modelo objetivo verifica los candidatos juntos y puede devolver varios tokens de salida por ronda. El trabajo adicional de propuesta puede ralentizar el serving si la aceptación es baja o si el modelo objetivo ya funciona de forma eficiente con lotes grandes.

Haz un benchmark del ciclo completo de generación, incluidas las propuestas y los rechazos, antes de elegir este método para un servicio.

Entender una ronda de verificación

Un modelo de propuesta genera K tokens. El modelo objetivo puntúa las posiciones candidatas en una pasada hacia delante por lotes. El muestreo por rechazo modificado acepta candidatos de izquierda a derecha utilizando ambas distribuciones. Tras el primer rechazo, extrae una corrección de la distribución residual del modelo objetivo y descarta los candidatos posteriores. Si todos los candidatos se aceptan, también puede extraer un token adicional del modelo objetivo.

El algoritmo de muestreo especulativo de Chen et al. conserva la distribución objetivo bajo los supuestos del algoritmo, con las limitaciones de la precisión numérica del hardware. Comparar simplemente los tokens candidatos con los seleccionados por el modelo objetivo no es el mismo algoritmo de muestreo. Comprueba el comportamiento de muestreo y los ajustes compatibles de la implementación elegida.

El artículo informó de una aceleración de la decodificación de 2–2.5x para el modelo objetivo Chinchilla-70B probado, con un modelo de propuesta de 4B, un lote de tamaño uno y K=4 en TPU v4. Ese resultado histórico demuestra que el mecanismo puede ayudar, pero no predice el rendimiento de otro par de modelos.

Comprobar qué determina la mejora

MedidaInterpretación
Tokens aceptados por ronda de verificaciónCuánta salida amortiza la ejecución del modelo objetivo
Tiempo de propuestaCoste de proponer candidatos
Tiempo de verificación y correcciónTrabajo del modelo objetivo y sobrecoste de los candidatos rechazados
Rendimiento y latencia según la concurrenciaSi la mejora se mantiene con lotes realistas
Calidad de la tarea y ajustes de muestreoSi el método elegido conserva el comportamiento previsto

Los métodos con modelos de propuesta son una opción. EAGLE-3 combina varios niveles de características del modelo objetivo y predice directamente los tokens propuestos; otros enfoques utilizan cabezas de predicción adicionales o coincidencias con el prompt. Sus tasas de aceptación y costes de ejecución difieren.

Prueba código, prosa, structured outputs y longitudes de contexto representativos. Empieza con pocos tokens propuestos y después varía esa cantidad junto con la concurrencia. Más candidatos no ayudan si el coste de proponerlos y verificarlos supera el trabajo que se evita.

Guía de ingeniería: decodificación especulativa explica la secuencia de aceptación y las variantes del método.