Préentraînement vs fine-tuning : en quoi les étapes des LLM diffèrent-elles ?

Traduction automatique

Cet article a été traduit automatiquement depuis la version originale en anglais.

Le préentraînement développe des capacités générales à partir d’un vaste corpus. Le fine-tuning supervisé apprend à un modèle à produire les réponses souhaitées à partir d’exemples. Les méthodes d’alignement l’entraînent selon des préférences ou des récompenses vérifiables. Ces méthodes correspondent à des objectifs d’entraînement différents ; un modèle utile peut passer par les trois.

Commencez par le comportement à modifier. Un document manquant, une erreur de classification répétée et une action dangereuse nécessitent des interventions différentes.

Que change chaque étape ?

ÉtapeSignal d’entraînementRésultat à évaluer
PréentraînementPour un LLM autorégressif, prédire le prochain token dans le texte du corpusCapacités générales de langage et de résolution de tâches
Fine-tuning supervisé, ou SFTExemples d’entrée et de réponse souhaitéeComportement sur la tâche illustrée par les exemples
Entraînement par préférences ou récompensesPaires de réponses avec une réponse préférée, scores appris ou vérifications fondées sur des règlesLe comportement récompensé et les effets secondaires indésirables

Le rapport technique de Llama 3 distingue le préentraînement à grande échelle du post-entraînement qui développe le suivi des instructions et d’autres capacités. Le préentraînement ne se limite pas toujours à la prédiction du prochain token : les modèles encodeurs et les modèles de débruitage peuvent utiliser d’autres objectifs.

SFT est généralement le point de départ le plus direct lorsque des exemples vérifiés montrent la sortie souhaitée. Par exemple, un dataset d’extraction peut associer un document aux champs corrects. L’entraînement par préférences convient aux comparaisons, comme déterminer laquelle de deux réponses respecte le mieux une politique. DPO optimise directement les paires de préférences, tandis qu’un pipeline RLHF classique entraîne un modèle de récompense, puis met à jour la politique par apprentissage par renforcement.

Choisir selon le défaut observé

Si les réponses nécessitent des faits qui évoluent ou des informations privées, fournissez d’abord ces données par recherche d’information. Si le modèle utilise à répétition les mauvaises étiquettes malgré un prompt clair, testez SFT sur des exemples vérifiés. Si plusieurs réponses acceptables diffèrent sur une préférence que vous pouvez juger de manière cohérente, envisagez l’entraînement par préférences.

Conservez un jeu d’évaluation distinct des données d’entraînement à chaque modification. Vérifiez le comportement ciblé, les régressions sur les tâches générales, les refus et le coût. Une perte d’entraînement plus faible ne prouve pas que le système déployé s’est amélioré.

Pour le choix au niveau de l’application, consultez fine-tuning vs RAG vs prompting. La section sur les étapes d’entraînement du Guide d’ingénierie des LLM présente un contexte plus large.