Preentrenamiento vs. fine-tuning: ¿en qué se diferencian las etapas de un LLM?

Traducción automática

Este artículo se tradujo automáticamente a partir de la versión original en inglés.

El preentrenamiento desarrolla capacidades generales a partir de un gran corpus. El fine-tuning supervisado enseña a un modelo a producir las respuestas deseadas mediante ejemplos. Los métodos de alineamiento lo entrenan según preferencias o recompensas verificables. Estos métodos tienen distintos objetivos de entrenamiento; un modelo útil puede pasar por los tres.

Empieza por el comportamiento que debe cambiar. La falta de un documento, un error de clasificación repetido y una acción insegura requieren intervenciones distintas.

¿Qué cambia en cada etapa?

EtapaSeñal de entrenamientoResultado que evaluar
PreentrenamientoEn un LLM autorregresivo, predecir el siguiente token en el texto del corpusCapacidades generales de lenguaje y de resolución de tareas
Fine-tuning supervisado, o SFTEjemplos de entrada y respuesta deseadaComportamiento en la tarea mostrada mediante ejemplos
Entrenamiento por preferencias o recompensasPares de respuestas con una preferida, puntuaciones aprendidas o comprobaciones basadas en reglasEl comportamiento recompensado y los efectos secundarios no deseados

El informe técnico de Llama 3 distingue el preentrenamiento a gran escala del entrenamiento posterior que desarrolla el seguimiento de instrucciones y otras capacidades. El preentrenamiento no siempre consiste en predecir el siguiente token: los modelos codificadores y los de eliminación de ruido pueden usar otros objetivos.

SFT suele ser el punto de partida más directo cuando los ejemplos revisados muestran la salida que quieres. Por ejemplo, un dataset de extracción puede emparejar un documento con los campos correctos. El entrenamiento por preferencias encaja con comparaciones como cuál de dos respuestas sigue mejor una política. DPO optimiza directamente los pares de preferencias, mientras que un pipeline convencional de RLHF entrena un modelo de recompensa y después actualiza la política mediante aprendizaje por refuerzo.

Elige según el fallo observado

Si las respuestas necesitan datos cambiantes o privados, proporciona primero esos datos mediante recuperación de información. Si el modelo utiliza repetidamente las etiquetas incorrectas pese a un prompt claro, prueba SFT con ejemplos revisados. Si varias respuestas aceptables difieren en una preferencia que puedes juzgar de forma consistente, considera el entrenamiento por preferencias.

Mantén un conjunto de evaluación separado del entrenamiento a lo largo de cada cambio. Comprueba el comportamiento objetivo, las regresiones en tareas generales, las negativas a responder y el coste. Una pérdida de entrenamiento menor no demuestra que el sistema desplegado haya mejorado.

Para decidir a nivel de aplicación, consulta fine-tuning vs. RAG vs. prompting. La sección sobre etapas de entrenamiento de la Guía de ingeniería de LLM ofrece un contexto más amplio.