Datos sintéticos de entrenamiento: ¿cómo genero ejemplos útiles?

Traducción automática

Este artículo se tradujo automáticamente a partir de la versión original en inglés.

Genera ejemplos sintéticos para cubrir carencias concretas de los datos reales de entrenamiento. Parte de casos revisados, varía las entradas de forma deliberada, verifica las salidas y prueba el modelo resultante con ejemplos reales reservados para la evaluación. Un dataset generado más grande solo resulta útil si mejora la tarea que mides.

Usa datos sintéticos para ampliar una cobertura que puedas comprobar, como etiquetas ausentes, formatos poco frecuentes o ejemplos con respuestas conocidas.

Define qué aporta cada ejemplo generado

Para una tarea de extracción, identifica primero el campo y el fallo que necesitas cubrir:

Fallo realVariación generada propuestaComprobación de la salida
La ausencia de un campo provoca un valor inventadoElimina ese campo de documentos que, por lo demás, son válidosEl campo esperado está vacío
Cambiar el orden de los campos impide la extracción correctaCambia la disposición sin alterar los valoresLos valores siguen coincidiendo con la fuente
Una etiqueta poco frecuente se clasifica malGenera casos diversos para esa etiqueta revisadaLa etiqueta supera la revisión

Conserva el caso de origen, el prompt de generación, la identidad del modelo profesor y el resultado de la validación. Esto permite eliminar o regenerar un subconjunto cuando cambia una regla de etiquetado.

Self-Instruct genera y filtra ejemplos de instrucciones a partir de un conjunto inicial. El informe técnico de Phi-4 describe métodos más elaborados de generación, crítica, revisión e inversión de instrucciones. Son opciones para producir datos; sus resultados publicados no certifican tus ejemplos.

Filtra antes de aumentar el volumen

Comprueba los duplicados, las respuestas sin respaldo, el equilibrio de las etiquetas, el idioma y la dificultad de la tarea. Usa verificadores deterministas cuando se conoce el resultado correcto y revisión humana cuando no se conoce. Mantén los casos de evaluación fuera de los prompts de generación y de los datos de entrenamiento.

El entrenamiento recursivo con datos generados puede perder patrones poco frecuentes. El estudio sobre el colapso de modelos examina este riesgo. Otro estudio sobre la acumulación de datos reales y sintéticos muestra que la estrategia de conservación de datos cambia el resultado. Los ejemplos sintéticos no provocan inevitablemente un colapso; la sustitución indiscriminada y la generación repetida requieren un examen especialmente cuidadoso.

Entrena con y sin el subconjunto sintético usando el mismo presupuesto. Consérvalo si mejora la calidad en datos reales reservados sin empeoramientos inaceptables, sobre todo en los casos poco frecuentes.

La sección sobre datos sintéticos de la guía de ingeniería de LLM explica los principales enfoques de generación.