Preentrenamiento vs. fine-tuning: ¿en qué se diferencian las etapas de un LLM?
Traducción automática
Este artículo se tradujo automáticamente a partir de la versión original en inglés.
El preentrenamiento desarrolla capacidades generales a partir de un gran corpus. El fine-tuning supervisado enseña a un modelo a producir las respuestas deseadas mediante ejemplos. Los métodos de alineamiento lo entrenan según preferencias o recompensas verificables. Estos métodos tienen distintos objetivos de entrenamiento; un modelo útil puede pasar por los tres.
Empieza por el comportamiento que debe cambiar. La falta de un documento, un error de clasificación repetido y una acción insegura requieren intervenciones distintas.
¿Qué cambia en cada etapa?
| Etapa | Señal de entrenamiento | Resultado que evaluar |
|---|---|---|
| Preentrenamiento | En un LLM autorregresivo, predecir el siguiente token en el texto del corpus | Capacidades generales de lenguaje y de resolución de tareas |
| Fine-tuning supervisado, o SFT | Ejemplos de entrada y respuesta deseada | Comportamiento en la tarea mostrada mediante ejemplos |
| Entrenamiento por preferencias o recompensas | Pares de respuestas con una preferida, puntuaciones aprendidas o comprobaciones basadas en reglas | El comportamiento recompensado y los efectos secundarios no deseados |
El informe técnico de Llama 3 distingue el preentrenamiento a gran escala del entrenamiento posterior que desarrolla el seguimiento de instrucciones y otras capacidades. El preentrenamiento no siempre consiste en predecir el siguiente token: los modelos codificadores y los de eliminación de ruido pueden usar otros objetivos.
SFT suele ser el punto de partida más directo cuando los ejemplos revisados muestran la salida que quieres. Por ejemplo, un dataset de extracción puede emparejar un documento con los campos correctos. El entrenamiento por preferencias encaja con comparaciones como cuál de dos respuestas sigue mejor una política. DPO optimiza directamente los pares de preferencias, mientras que un pipeline convencional de RLHF entrena un modelo de recompensa y después actualiza la política mediante aprendizaje por refuerzo.
Elige según el fallo observado
Si las respuestas necesitan datos cambiantes o privados, proporciona primero esos datos mediante recuperación de información. Si el modelo utiliza repetidamente las etiquetas incorrectas pese a un prompt claro, prueba SFT con ejemplos revisados. Si varias respuestas aceptables difieren en una preferencia que puedes juzgar de forma consistente, considera el entrenamiento por preferencias.
Mantén un conjunto de evaluación separado del entrenamiento a lo largo de cada cambio. Comprueba el comportamiento objetivo, las regresiones en tareas generales, las negativas a responder y el coste. Una pérdida de entrenamiento menor no demuestra que el sistema desplegado haya mejorado.
Para decidir a nivel de aplicación, consulta fine-tuning vs. RAG vs. prompting. La sección sobre etapas de entrenamiento de la Guía de ingeniería de LLM ofrece un contexto más amplio.