RLHF vs DPO vs GRPO: hoe verschillen alignmentmethoden?

Automatische vertaling

Dit artikel is automatisch vertaald vanuit de oorspronkelijke Engelse versie.

Conventionele PPO-gebaseerde RLHF traint een policy met een reward model dat is geleerd uit menselijke voorkeuren. DPO leert rechtstreeks van paren met een voorkeursantwoord en een afgewezen antwoord. GRPO genereert via sampling groepen antwoorden en vergelijkt hun rewards om de policy bij te werken zonder de aangeleerde critic van PPO.

RLHF beschrijft de aanpak met menselijke feedback; PPO, DPO en GRPO beschrijven trainingsmethoden. GRPO kan verifieerbare regels of een aangeleerd reward model gebruiken in plaats van menselijke beoordelingen.

Kies op basis van de feedback die je kunt vertrouwen

MethodeTrainingsfeedbackNieuwe antwoorden tijdens training?Geschikte voorwaarde
PPO-gebaseerde RLHFAangeleerde rewardscoreJaOnline exploratie is nodig en het reward model is getest
Standaard-DPOParen met voorkeursantwoorden en afgewezen antwoordenNee; vaste parenBeoordeelde vergelijkingen dekken het gewenste gedrag
GRPORewards ten opzichte van andere antwoorden in de groepJaDe taak biedt informatieve, herhaalbare rewardcontroles

Het DPO-artikel leidt een doelfunctie voor voorkeursparen af die de aparte training van een reward model en de online reinforcement-learninglus van conventionele RLHF vermijdt. Dat vereenvoudigt de implementatie, maar vaste paren kunnen geen antwoorden verkennen die ontbreken in de dataset.

DeepSeekMath introduceerde de groepsbaseline van GRPO zonder critic. Bij een wiskundetaak kunnen meerdere via sampling gegenereerde antwoorden rewards krijgen voor hun correctheid. Als elk antwoord dezelfde reward krijgt, levert de groep weinig informatie over welk gedrag moet verbeteren.

Tel de werkelijke trainingstoestand

Een conventionele PPO-pipeline heeft rollen voor de policy, het referentiemodel, het reward model en het value model. Daarvoor hoeven niet vier volledige kopieën op elke GPU aanwezig te zijn. Delen, adapters, sharding en offload veranderen het geheugengebruik.

Ook het referentiemodel van GRPO hangt af van de implementatie. De huidige TRL GRPO-trainer gebruikt standaard een KL-coëfficiënt van nul en laadt in die configuratie geen referentiemodel. Het inschakelen van KL-regularisatie met een referentiemodel of een aangeleerd reward model voegt toestand toe.

Evalueer het getrainde model op apart gehouden taken en controleer of het zwakke punten in de rewardbepaling uitbuit. Een geslaagde unit test, een voorkeursscore of een correct eindgetal controleert alleen wat de evaluator meet. Vergelijk naast de beloonde metriek ook regressies op algemene taken en de generatiekosten.

De sectie over alignmentmethoden in de LLM Engineering Guide geeft de bredere trainingscontext.