RLHF vs DPO vs GRPO : en quoi les méthodes d’alignement diffèrent-elles ?

Traduction automatique

Cet article a été traduit automatiquement depuis la version originale en anglais.

Le RLHF conventionnel basé sur PPO entraîne une politique à partir d’un modèle de récompense appris sur des préférences humaines. DPO apprend directement à partir de paires de réponses préférées et rejetées. GRPO échantillonne des groupes de réponses et compare leurs récompenses pour mettre à jour la politique sans le critique appris de PPO.

RLHF désigne l’approche fondée sur les retours humains ; PPO, DPO et GRPO désignent des méthodes d’entraînement. GRPO peut utiliser des règles vérifiables ou un modèle de récompense appris plutôt que des jugements humains.

Choisissez selon les retours auxquels vous pouvez vous fier

MéthodeRetours utilisés pour l’entraînementNouvelles réponses pendant l’entraînement ?Condition favorable
RLHF basé sur PPOScore de récompense apprisOuiL’exploration en ligne est nécessaire et le modèle de récompense a été testé
DPO standardPaires de réponses préférées et rejetéesNon ; paires fixesLes comparaisons examinées couvrent le comportement souhaité
GRPORécompenses relatives aux autres réponses du groupeOuiLa tâche permet des vérifications de récompense informatives et répétables

L’article sur DPO dérive un objectif fondé sur des paires de préférences qui évite l’entraînement séparé du modèle de récompense et la boucle d’apprentissage par renforcement en ligne du RLHF conventionnel. Cela simplifie l’implémentation, mais les paires fixes ne permettent pas d’explorer les réponses absentes du dataset.

DeepSeekMath a introduit la référence de groupe de GRPO, sans critique. Pour une tâche mathématique, plusieurs réponses échantillonnées peuvent recevoir des récompenses selon leur exactitude. Si chaque réponse reçoit la même récompense, le groupe fournit peu d’informations sur le comportement à améliorer.

Comptabilisez l’état réel de l’entraînement

Un pipeline PPO conventionnel comprend les rôles de politique, de référence, de récompense et de modèle de valeur. Ils ne nécessitent pas forcément quatre copies complètes résidant sur chaque GPU. Le partage, les adaptateurs, le partitionnement et le transfert vers d’autres dispositifs modifient l’utilisation de la mémoire.

Le modèle de référence de GRPO dépend lui aussi de l’implémentation. L’entraîneur GRPO de TRL actuel utilise par défaut un coefficient KL nul et ne charge pas de modèle de référence dans cette configuration. Activer la régularisation KL fondée sur une référence ou un modèle de récompense appris ajoute de l’état.

Évaluez le modèle entraîné sur des tâches réservées à l’évaluation et vérifiez s’il exploite les faiblesses de la récompense. Un test unitaire réussi, un score de préférence ou un résultat numérique final correct ne vérifie que ce que mesure l’évaluateur. Comparez aussi les régressions sur les tâches générales et le coût de génération, en plus de la métrique récompensée.

La section sur les méthodes d’alignement du LLM Engineering Guide présente le contexte plus large de l’entraînement.