Distillation des LLM : comment les petits modèles apprennent-ils des enseignants ?

Traduction automatique

Cet article a été traduit automatiquement depuis la version originale en anglais.

La distillation des LLM entraîne un modèle élève à partir de signaux produits par un modèle enseignant. Les méthodes fondées sur les logits cherchent à reproduire les distributions de sortie. Les méthodes fondées sur les données utilisent des exemples générés par l’enseignant. Envisagez la distillation lorsqu’un modèle plus petit pourrait atteindre un seuil défini pour une tâche à un coût de serving inférieur.

La distillation ne garantit pas que l’élève conserve toutes les capacités de l’enseignant. La couverture des données et la tâche d’évaluation déterminent ce qui se transmet.

Deux façons de transférer un comportement

MéthodeInformations de l’enseignantExigence principale
Distillation fondée sur les logitsProbabilités des tokens ou logitsAccès aux distributions et objectif d’entraînement compatible
Distillation fondée sur les donnéesExemples d’entrée et de sortie générésExemples vérifiés ou filtrés et fine-tuning de l’élève

Un enseignant accessible uniquement par API peut permettre une distillation fondée sur les données même s’il n’expose pas les distributions nécessaires à votre méthode d’entraînement sur les logits. Des tokeniseurs ou des architectures différents peuvent compliquer la correspondance directe entre distributions.

Le rapport DeepSeek-R1 décrit le fine-tuning de modèles Qwen et Llama plus petits sur un mélange sélectionné d’environ 800,000 exemples. Ses modèles distillés ont obtenu de bons résultats sur les benchmarks de raisonnement de l’article. Ces résultats montrent que le transfert a fonctionné dans cette configuration ; ils ne prouvent pas qu’un petit élève peut remplacer n’importe quel enseignant pour n’importe quelle charge de travail.

Construire des exemples pour une tâche mesurable

Pour un classificateur de demandes d’assistance, fournissez de vrais types de questions et demandez à l’enseignant de proposer des étiquettes et des explications. Vérifiez les étiquettes par rapport à une taxonomie validée ; rejetez les classifications sans fondement. Incluez des classes rares et des cas ambigus plutôt que de produire de nombreuses paraphrases simples de demandes courantes.

Séparez les exemples d’entraînement générés par l’enseignant du jeu d’évaluation réservé. Sinon, l’élève peut sembler performant parce que le test réutilise des exemples d’entraînement au lieu de mesurer des cas inédits. Vérifiez que les conditions d’utilisation de l’enseignant autorisent l’usage prévu pour l’entraînement avant de générer le dataset.

Comparez l’élève à l’enseignant et à son propre modèle de base sans adaptation. Mesurez la qualité sur la tâche, les types d’erreurs, la longueur des sorties, la latence et le coût avec le nombre de requêtes simultanées prévu. Incluez les appels de secours à l’enseignant dans l’estimation des économies.

Utilisez les explications de l’enseignant uniquement lorsqu’elles améliorent le comportement mesuré de l’élève ; les sorties cibles plus longues coûtent aussi davantage à générer et à apprendre pendant l’entraînement.

La section sur la distillation du LLM Engineering Guide décrit les comparaisons publiées de R1 et leurs limites.