RLHF vs DPO vs GRPO: Wie unterscheiden sich Alignment-Methoden?
Automatische Übersetzung
Dieser Artikel wurde automatisch aus der englischen Originalversion übersetzt.
Konventionelles PPO-basiertes RLHF trainiert eine Policy anhand eines Reward-Modells, das aus menschlichen Präferenzen gelernt wurde. DPO lernt direkt aus Paaren bevorzugter und abgelehnter Antworten. GRPO erzeugt Gruppen von Antworten durch Sampling und vergleicht ihre Rewards, um die Policy ohne den gelernten Critic von PPO zu aktualisieren.
RLHF bezeichnet den Ansatz mit menschlichem Feedback; PPO, DPO und GRPO bezeichnen Trainingsmethoden. GRPO kann überprüfbare Regeln oder ein gelerntes Reward-Modell anstelle menschlicher Bewertungen nutzen.
Wählen Sie nach dem Feedback, dem Sie vertrauen können
| Methode | Trainingsfeedback | Neue Antworten während des Trainings? | Geeignete Voraussetzung |
|---|---|---|---|
| PPO-basiertes RLHF | Gelernter Reward-Score | Ja | Online-Exploration ist nötig und das Reward-Modell wurde getestet |
| Standard-DPO | Paare bevorzugter und abgelehnter Antworten | Nein; feste Paare | Geprüfte Vergleiche decken das gewünschte Verhalten ab |
| GRPO | Rewards relativ zu anderen Antworten in der Gruppe | Ja | Die Aufgabe bietet aussagekräftige, wiederholbare Reward-Prüfungen |
Das DPO-Paper leitet eine Zielfunktion für Präferenzpaare her, die das separate Training eines Reward-Modells und die Online-Reinforcement-Learning-Schleife des konventionellen RLHF vermeidet. Das vereinfacht die Implementierung, aber feste Paare erlauben keine Exploration von Antworten, die im Dataset fehlen.
DeepSeekMath führte die Gruppenbaseline von GRPO ohne Critic ein. Bei einer Mathematikaufgabe können mehrere durch Sampling erzeugte Antworten Rewards für ihre Korrektheit erhalten. Erhält jede Antwort denselben Reward, liefert die Gruppe wenig Information darüber, welches Verhalten verbessert werden sollte.
Erfassen Sie den tatsächlichen Trainingszustand
Eine konventionelle PPO-Pipeline umfasst die Rollen Policy, Referenzmodell, Reward-Modell und Wertmodell. Dafür müssen nicht vier vollständige Kopien auf jeder GPU liegen. Gemeinsame Nutzung, Adapter, Sharding und Offload verändern den Speicherbedarf.
Auch das Referenzmodell von GRPO hängt von der Implementierung ab. Der aktuelle TRL-GRPO-Trainer verwendet standardmäßig einen KL-Koeffizienten von null und lädt in dieser Konfiguration kein Referenzmodell. Referenzbasierte KL-Regularisierung oder ein gelerntes Reward-Modell fügen weiteren Zustand hinzu.
Evaluieren Sie das trainierte Modell anhand zurückgehaltener Aufgaben und prüfen Sie, ob es Schwächen der Reward-Bewertung ausnutzt. Ein bestandener Unit-Test, ein Präferenzscore oder eine korrekte Endzahl prüft nur das, was der Evaluator misst. Vergleichen Sie neben der belohnten Metrik auch Verschlechterungen bei allgemeinen Aufgaben und die Generierungskosten.
Der Abschnitt zu Alignment-Methoden im LLM Engineering Guide erläutert den weiteren Trainingskontext.