RLHF vs DPO vs GRPO: em que diferem os métodos de alinhamento?
Tradução automática
Este artigo foi traduzido automaticamente a partir da versão original em inglês.
O RLHF convencional baseado em PPO treina uma política com um modelo de recompensa aprendido a partir de preferências humanas. O DPO aprende diretamente com pares de respostas preferidas e rejeitadas. O GRPO amostra grupos de respostas e compara as suas recompensas para atualizar a política sem o crítico aprendido do PPO.
RLHF descreve a abordagem baseada em feedback humano; PPO, DPO e GRPO descrevem métodos de treino. O GRPO pode usar regras verificáveis ou um modelo de recompensa aprendido em vez de avaliações humanas.
Escolha segundo o feedback em que pode confiar
| Método | Feedback de treino | Novas respostas durante o treino? | Condição favorável |
|---|---|---|---|
| RLHF baseado em PPO | Pontuação de recompensa aprendida | Sim | É necessária exploração em linha e o modelo de recompensa foi testado |
| DPO padrão | Pares de respostas preferidas e rejeitadas | Não; pares fixos | As comparações revistas abrangem o comportamento pretendido |
| GRPO | Recompensas relativas às outras respostas do grupo | Sim | A tarefa permite verificações de recompensa informativas e repetíveis |
O artigo sobre DPO deduz uma função objetivo baseada em pares de preferências que evita o treino separado do modelo de recompensa e o ciclo de aprendizagem por reforço em linha do RLHF convencional. Isso simplifica a implementação, mas os pares fixos não permitem explorar respostas ausentes do dataset.
O DeepSeekMath introduziu a referência de grupo do GRPO sem crítico. Numa tarefa matemática, várias respostas amostradas podem receber recompensas pela sua correção. Se todas receberem a mesma recompensa, o grupo fornece pouca informação sobre o comportamento a melhorar.
Conte o estado real do treino
Uma pipeline convencional de PPO inclui as funções de política, referência, recompensa e modelo de valor. Não precisam de ser quatro cópias completas residentes em cada GPU. A partilha, os adaptadores, o particionamento e a transferência para outros dispositivos alteram o uso de memória.
O modelo de referência do GRPO também depende da implementação. O atual módulo de treino GRPO do TRL usa por predefinição um coeficiente KL de zero e não carrega um modelo de referência nessa configuração. Ativar a regularização KL baseada numa referência ou um modelo de recompensa aprendido acrescenta estado.
Avalie o modelo treinado em tarefas reservadas para avaliação e verifique se explora falhas na recompensa. Um teste unitário aprovado, uma pontuação de preferências ou um número final correto verificam apenas o que o avaliador mede. Compare também as regressões em tarefas gerais e o custo de geração, além da métrica recompensada.
A secção sobre métodos de alinhamento do LLM Engineering Guide apresenta um contexto mais amplo sobre o treino.