RLHF vs DPO vs GRPO: czym różnią się metody dostrajania do preferencji?

Tłumaczenie automatyczne

Ten artykuł został automatycznie przetłumaczony z angielskiego oryginału.

Konwencjonalny RLHF oparty na PPO trenuje politykę z wykorzystaniem modelu nagrody wyuczonego na podstawie ludzkich preferencji. DPO uczy się bezpośrednio z par odpowiedzi preferowanych i odrzuconych. GRPO próbkuje grupy odpowiedzi i porównuje ich nagrody, aby aktualizować politykę bez wyuczonego krytyka stosowanego w PPO.

RLHF opisuje podejście wykorzystujące informację zwrotną od ludzi; PPO, DPO i GRPO opisują metody treningu. GRPO może korzystać z weryfikowalnych reguł lub wyuczonego modelu nagrody zamiast ocen ludzi.

Wybieraj według informacji zwrotnej, której możesz zaufać

MetodaInformacja zwrotna podczas treninguNowe odpowiedzi podczas treningu?Odpowiedni warunek
RLHF oparty na PPOWyuczona ocena nagrodyTakPotrzebna jest eksploracja online, a model nagrody został przetestowany
Standardowe DPOPary odpowiedzi preferowanych i odrzuconychNie; stałe parySprawdzone porównania obejmują pożądane zachowanie
GRPONagrody względem innych odpowiedzi w grupieTakZadanie pozwala na informatywne, powtarzalne sprawdzanie nagród

Artykuł o DPO wyprowadza funkcję celu opartą na parach preferencji, która eliminuje osobny trening modelu nagrody i pętlę uczenia ze wzmocnieniem online z konwencjonalnego RLHF. To upraszcza implementację, ale stałe pary nie pozwalają eksplorować odpowiedzi nieobecnych w zbiorze danych.

DeepSeekMath wprowadził grupowy poziom odniesienia GRPO bez krytyka. W zadaniu matematycznym kilka próbkowanych odpowiedzi może otrzymać nagrody za poprawność. Jeśli każda odpowiedź otrzymuje tę samą nagrodę, grupa dostarcza niewiele informacji o tym, które zachowanie należy poprawić.

Uwzględnij rzeczywisty stan treningu

Konwencjonalny potok PPO obejmuje role polityki, modelu referencyjnego, modelu nagrody i modelu wartości. Nie muszą one oznaczać czterech pełnych kopii przechowywanych na każdym GPU. Współdzielenie, adaptery, dzielenie na fragmenty i przenoszenie danych na inne urządzenia zmieniają zużycie pamięci.

Model referencyjny GRPO również zależy od implementacji. Obecny moduł treningowy GRPO w TRL domyślnie używa zerowego współczynnika KL i w tej konfiguracji nie ładuje modelu referencyjnego. Włączenie regularyzacji KL z modelem referencyjnym lub wyuczonego modelu nagrody dodaje stan.

Przeprowadź ewaluację wytrenowanego modelu na zadaniach niewykorzystanych w treningu i sprawdź, czy wykorzystuje słabości mechanizmu nagradzania. Zaliczony test jednostkowy, wynik preferencji lub poprawna końcowa liczba sprawdzają tylko to, co mierzy ewaluator. Oprócz nagradzanej metryki porównaj też pogorszenie wyników w zadaniach ogólnych i koszt generowania.

Sekcja o metodach dostrajania do preferencji w LLM Engineering Guide przedstawia szerszy kontekst treningu.