Destilación de LLM: ¿cómo aprenden los modelos pequeños de los profesores?
Traducción automática
Este artículo se tradujo automáticamente a partir de la versión original en inglés.
La destilación de LLM entrena un modelo alumno con señales producidas por un modelo profesor. Los métodos basados en logits ajustan las distribuciones de salida. Los métodos basados en datos entrenan con ejemplos generados por el profesor. Considera la destilación cuando un modelo más pequeño pueda alcanzar un umbral definido para una tarea con un menor coste de serving.
La destilación no garantiza que el alumno conserve todas las capacidades del profesor. La cobertura de los datos y la tarea de evaluación determinan qué se transfiere.
Dos formas de transferir comportamiento
| Método | Información del profesor | Requisito principal |
|---|---|---|
| Destilación basada en logits | Probabilidades de tokens o logits | Acceso a las distribuciones y un objetivo de entrenamiento compatible |
| Destilación basada en datos | Ejemplos generados de entrada y salida | Ejemplos revisados o filtrados y fine-tuning del alumno |
Un profesor accesible únicamente mediante una API puede permitir la destilación basada en datos aunque no exponga las distribuciones necesarias para tu método de entrenamiento con logits. Las diferencias entre tokenizadores o arquitecturas pueden complicar el ajuste directo de distribuciones.
El informe de DeepSeek-R1 describe el fine-tuning de modelos Qwen y Llama más pequeños con una mezcla seleccionada de unos 800,000 ejemplos. Sus modelos destilados obtuvieron buenos resultados en los benchmarks de razonamiento del artículo. Esos resultados demuestran que la transferencia funcionó en esa configuración; no muestran que un alumno pequeño pueda sustituir a cualquier profesor en cualquier carga de trabajo.
Crea ejemplos para una tarea medible
Para un clasificador de consultas de soporte, proporciona tipos de preguntas reales y pide al profesor que proponga etiquetas y explicaciones. Comprueba las etiquetas con una taxonomía revisada; rechaza las clasificaciones sin fundamento. Incluye clases poco frecuentes y casos ambiguos en lugar de generar muchas paráfrasis sencillas de solicitudes habituales.
Separa los ejemplos de entrenamiento generados por el profesor del conjunto de evaluación reservado. De lo contrario, el alumno puede parecer competente porque la prueba reutiliza ejemplos del entrenamiento en vez de medir casos no vistos. Antes de generar el dataset, verifica que las condiciones del profesor permiten el uso previsto para entrenamiento.
Compara al alumno tanto con el profesor como con su propio modelo base sin ajustar. Mide la calidad en la tarea, los tipos de error, la longitud de la salida, la latencia y el coste con la concurrencia prevista. Incluye las llamadas de respaldo al profesor al estimar el ahorro.
Utiliza las explicaciones del profesor solo cuando mejoren el comportamiento medido del alumno; las salidas objetivo más largas también cuestan más de generar y aprender durante el entrenamiento.
La sección sobre destilación de la LLM Engineering Guide describe las comparaciones publicadas de R1 y sus límites.