RLHF vs DPO vs GRPO: чем отличаются методы согласования с предпочтениями?
Автоматический перевод
Эта статья была автоматически переведена с оригинальной английской версии.
Обычный RLHF на основе PPO обучает политику с помощью модели награды, обученной на человеческих предпочтениях. DPO учится напрямую на парах предпочтительных и отклонённых ответов. GRPO генерирует группы ответов и сравнивает их награды, чтобы обновлять политику без обучаемого критика PPO.
RLHF обозначает подход с обратной связью от людей; PPO, DPO и GRPO обозначают методы обучения. GRPO может использовать проверяемые правила или обученную модель награды вместо человеческих оценок.
Выбирайте по обратной связи, которой можете доверять
| Метод | Обратная связь при обучении | Новые ответы во время обучения? | Подходящее условие |
|---|---|---|---|
| RLHF на основе PPO | Оценка обученной модели награды | Да | Нужно исследовать новые ответы во время обучения, а модель награды проверена |
| Стандартный DPO | Пары предпочтительных и отклонённых ответов | Нет; фиксированные пары | Проверенные сравнения охватывают нужное поведение |
| GRPO | Награды относительно других ответов в группе | Да | Задача допускает информативные, повторяемые проверки награды |
Статья о DPO выводит целевую функцию для пар предпочтений, которая позволяет обойтись без отдельного обучения модели награды и цикла обучения с подкреплением с генерацией новых ответов, характерного для обычного RLHF. Это упрощает реализацию, но фиксированные пары не позволяют исследовать ответы, отсутствующие в датасете.
DeepSeekMath представил групповую базовую оценку GRPO без критика. В математической задаче несколько сгенерированных ответов могут получать награды за правильность. Если все ответы получают одинаковую награду, группа даёт мало информации о том, какое поведение нужно улучшить.
Учитывайте фактическое состояние обучения
В обычном пайплайне PPO есть роли политики, референсной модели, модели награды и модели ценности. Для них не обязательно хранить четыре полные копии на каждом GPU. Совместное использование, адаптеры, шардинг и выгрузка на другие устройства меняют расход памяти.
Референсная модель GRPO тоже зависит от реализации. Текущий тренер GRPO в TRL по умолчанию использует нулевой коэффициент KL и в этой конфигурации не загружает референсную модель. Включение KL-регуляризации с референсной моделью или обученной модели награды добавляет состояние.
Оценивайте обученную модель на задачах, не использованных при обучении, и проверяйте, не использует ли она недостатки механизма награды. Пройденный юнит-тест, оценка предпочтений или правильное итоговое число проверяют только то, что измеряет эвалуатор. Помимо награждаемой метрики сравнивайте ухудшение результатов на общих задачах и стоимость генерации.
Раздел о методах согласования с предпочтениями в LLM Engineering Guide описывает более широкий контекст обучения.