RLHF vs DPO vs GRPO: czym różnią się metody dostrajania do preferencji?
Tłumaczenie automatyczne
Ten artykuł został automatycznie przetłumaczony z angielskiego oryginału.
Konwencjonalny RLHF oparty na PPO trenuje politykę z wykorzystaniem modelu nagrody wyuczonego na podstawie ludzkich preferencji. DPO uczy się bezpośrednio z par odpowiedzi preferowanych i odrzuconych. GRPO próbkuje grupy odpowiedzi i porównuje ich nagrody, aby aktualizować politykę bez wyuczonego krytyka stosowanego w PPO.
RLHF opisuje podejście wykorzystujące informację zwrotną od ludzi; PPO, DPO i GRPO opisują metody treningu. GRPO może korzystać z weryfikowalnych reguł lub wyuczonego modelu nagrody zamiast ocen ludzi.
Wybieraj według informacji zwrotnej, której możesz zaufać
| Metoda | Informacja zwrotna podczas treningu | Nowe odpowiedzi podczas treningu? | Odpowiedni warunek |
|---|---|---|---|
| RLHF oparty na PPO | Wyuczona ocena nagrody | Tak | Potrzebna jest eksploracja online, a model nagrody został przetestowany |
| Standardowe DPO | Pary odpowiedzi preferowanych i odrzuconych | Nie; stałe pary | Sprawdzone porównania obejmują pożądane zachowanie |
| GRPO | Nagrody względem innych odpowiedzi w grupie | Tak | Zadanie pozwala na informatywne, powtarzalne sprawdzanie nagród |
Artykuł o DPO wyprowadza funkcję celu opartą na parach preferencji, która eliminuje osobny trening modelu nagrody i pętlę uczenia ze wzmocnieniem online z konwencjonalnego RLHF. To upraszcza implementację, ale stałe pary nie pozwalają eksplorować odpowiedzi nieobecnych w zbiorze danych.
DeepSeekMath wprowadził grupowy poziom odniesienia GRPO bez krytyka. W zadaniu matematycznym kilka próbkowanych odpowiedzi może otrzymać nagrody za poprawność. Jeśli każda odpowiedź otrzymuje tę samą nagrodę, grupa dostarcza niewiele informacji o tym, które zachowanie należy poprawić.
Uwzględnij rzeczywisty stan treningu
Konwencjonalny potok PPO obejmuje role polityki, modelu referencyjnego, modelu nagrody i modelu wartości. Nie muszą one oznaczać czterech pełnych kopii przechowywanych na każdym GPU. Współdzielenie, adaptery, dzielenie na fragmenty i przenoszenie danych na inne urządzenia zmieniają zużycie pamięci.
Model referencyjny GRPO również zależy od implementacji. Obecny moduł treningowy GRPO w TRL domyślnie używa zerowego współczynnika KL i w tej konfiguracji nie ładuje modelu referencyjnego. Włączenie regularyzacji KL z modelem referencyjnym lub wyuczonego modelu nagrody dodaje stan.
Przeprowadź ewaluację wytrenowanego modelu na zadaniach niewykorzystanych w treningu i sprawdź, czy wykorzystuje słabości mechanizmu nagradzania. Zaliczony test jednostkowy, wynik preferencji lub poprawna końcowa liczba sprawdzają tylko to, co mierzy ewaluator. Oprócz nagradzanej metryki porównaj też pogorszenie wyników w zadaniach ogólnych i koszt generowania.
Sekcja o metodach dostrajania do preferencji w LLM Engineering Guide przedstawia szerszy kontekst treningu.