RLHF vs DPO vs GRPO: чем отличаются методы согласования с предпочтениями?

Автоматический перевод

Эта статья была автоматически переведена с оригинальной английской версии.

Обычный RLHF на основе PPO обучает политику с помощью модели награды, обученной на человеческих предпочтениях. DPO учится напрямую на парах предпочтительных и отклонённых ответов. GRPO генерирует группы ответов и сравнивает их награды, чтобы обновлять политику без обучаемого критика PPO.

RLHF обозначает подход с обратной связью от людей; PPO, DPO и GRPO обозначают методы обучения. GRPO может использовать проверяемые правила или обученную модель награды вместо человеческих оценок.

Выбирайте по обратной связи, которой можете доверять

МетодОбратная связь при обученииНовые ответы во время обучения?Подходящее условие
RLHF на основе PPOОценка обученной модели наградыДаНужно исследовать новые ответы во время обучения, а модель награды проверена
Стандартный DPOПары предпочтительных и отклонённых ответовНет; фиксированные парыПроверенные сравнения охватывают нужное поведение
GRPOНаграды относительно других ответов в группеДаЗадача допускает информативные, повторяемые проверки награды

Статья о DPO выводит целевую функцию для пар предпочтений, которая позволяет обойтись без отдельного обучения модели награды и цикла обучения с подкреплением с генерацией новых ответов, характерного для обычного RLHF. Это упрощает реализацию, но фиксированные пары не позволяют исследовать ответы, отсутствующие в датасете.

DeepSeekMath представил групповую базовую оценку GRPO без критика. В математической задаче несколько сгенерированных ответов могут получать награды за правильность. Если все ответы получают одинаковую награду, группа даёт мало информации о том, какое поведение нужно улучшить.

Учитывайте фактическое состояние обучения

В обычном пайплайне PPO есть роли политики, референсной модели, модели награды и модели ценности. Для них не обязательно хранить четыре полные копии на каждом GPU. Совместное использование, адаптеры, шардинг и выгрузка на другие устройства меняют расход памяти.

Референсная модель GRPO тоже зависит от реализации. Текущий тренер GRPO в TRL по умолчанию использует нулевой коэффициент KL и в этой конфигурации не загружает референсную модель. Включение KL-регуляризации с референсной моделью или обученной модели награды добавляет состояние.

Оценивайте обученную модель на задачах, не использованных при обучении, и проверяйте, не использует ли она недостатки механизма награды. Пройденный юнит-тест, оценка предпочтений или правильное итоговое число проверяют только то, что измеряет эвалуатор. Помимо награждаемой метрики сравнивайте ухудшение результатов на общих задачах и стоимость генерации.

Раздел о методах согласования с предпочтениями в LLM Engineering Guide описывает более широкий контекст обучения.