RLHF vs DPO vs GRPO: ¿En qué se diferencian los métodos de alineamiento?

Traducción automática

Este artículo se tradujo automáticamente a partir de la versión original en inglés.

El RLHF convencional basado en PPO entrena una política con un modelo de recompensa aprendido a partir de preferencias humanas. DPO aprende directamente de pares de respuestas preferidas y rechazadas. GRPO muestrea grupos de respuestas y compara sus recompensas para actualizar la política sin el crítico aprendido de PPO.

RLHF describe el enfoque basado en retroalimentación humana; PPO, DPO y GRPO describen métodos de entrenamiento. GRPO puede utilizar reglas verificables o un modelo de recompensa aprendido en lugar de valoraciones humanas.

Elige según la retroalimentación en la que puedas confiar

MétodoRetroalimentación de entrenamiento¿Respuestas nuevas durante el entrenamiento?Condición favorable
RLHF basado en PPOPuntuación de recompensa aprendidaSíSe necesita exploración en línea y el modelo de recompensa está probado
DPO estándarPares de respuestas preferidas y rechazadasNo; pares fijosLas comparaciones revisadas cubren el comportamiento deseado
GRPORecompensas relativas a las demás respuestas del grupoSíLa tarea permite comprobaciones de recompensa informativas y repetibles

El artículo de DPO deriva una función objetivo basada en pares de preferencias que evita el entrenamiento separado del modelo de recompensa y el bucle de aprendizaje por refuerzo en línea del RLHF convencional. Esto simplifica la implementación, pero los pares fijos no permiten explorar respuestas ausentes del dataset.

DeepSeekMath introdujo la referencia de grupo de GRPO sin crítico. En una tarea matemática, varias respuestas muestreadas pueden recibir recompensas por su corrección. Si todas reciben la misma recompensa, el grupo aporta poca información sobre qué comportamiento mejorar.

Cuenta el estado real del entrenamiento

Una pipeline convencional de PPO incluye las funciones de política, referencia, recompensa y modelo de valor. No tienen por qué ser cuatro copias completas residentes en cada GPU. La compartición, los adaptadores, el particionado y la descarga a otros dispositivos cambian el uso de memoria.

El modelo de referencia de GRPO también depende de la implementación. El entrenador GRPO de TRL actual utiliza por defecto un coeficiente KL de cero y no carga un modelo de referencia en esa configuración. Activar la regularización KL basada en una referencia o un modelo de recompensa aprendido añade estado.

Evalúa el modelo entrenado en tareas reservadas para evaluación e inspecciona si explota debilidades de la recompensa. Una prueba unitaria superada, una puntuación de preferencias o un número final correcto solo comprueban lo que mide el evaluador. Compara también los retrocesos en tareas generales y el coste de generación, además de la métrica recompensada.

La sección sobre métodos de alineamiento de la LLM Engineering Guide ofrece un contexto más amplio sobre el entrenamiento.