Datos sintéticos de entrenamiento: ¿cómo genero ejemplos útiles?
Traducción automática
Este artículo se tradujo automáticamente a partir de la versión original en inglés.
Genera ejemplos sintéticos para cubrir carencias concretas de los datos reales de entrenamiento. Parte de casos revisados, varía las entradas de forma deliberada, verifica las salidas y prueba el modelo resultante con ejemplos reales reservados para la evaluación. Un dataset generado más grande solo resulta útil si mejora la tarea que mides.
Usa datos sintéticos para ampliar una cobertura que puedas comprobar, como etiquetas ausentes, formatos poco frecuentes o ejemplos con respuestas conocidas.
Define qué aporta cada ejemplo generado
Para una tarea de extracción, identifica primero el campo y el fallo que necesitas cubrir:
| Fallo real | Variación generada propuesta | Comprobación de la salida |
|---|---|---|
| La ausencia de un campo provoca un valor inventado | Elimina ese campo de documentos que, por lo demás, son válidos | El campo esperado está vacío |
| Cambiar el orden de los campos impide la extracción correcta | Cambia la disposición sin alterar los valores | Los valores siguen coincidiendo con la fuente |
| Una etiqueta poco frecuente se clasifica mal | Genera casos diversos para esa etiqueta revisada | La etiqueta supera la revisión |
Conserva el caso de origen, el prompt de generación, la identidad del modelo profesor y el resultado de la validación. Esto permite eliminar o regenerar un subconjunto cuando cambia una regla de etiquetado.
Self-Instruct genera y filtra ejemplos de instrucciones a partir de un conjunto inicial. El informe técnico de Phi-4 describe métodos más elaborados de generación, crítica, revisión e inversión de instrucciones. Son opciones para producir datos; sus resultados publicados no certifican tus ejemplos.
Filtra antes de aumentar el volumen
Comprueba los duplicados, las respuestas sin respaldo, el equilibrio de las etiquetas, el idioma y la dificultad de la tarea. Usa verificadores deterministas cuando se conoce el resultado correcto y revisión humana cuando no se conoce. Mantén los casos de evaluación fuera de los prompts de generación y de los datos de entrenamiento.
El entrenamiento recursivo con datos generados puede perder patrones poco frecuentes. El estudio sobre el colapso de modelos examina este riesgo. Otro estudio sobre la acumulación de datos reales y sintéticos muestra que la estrategia de conservación de datos cambia el resultado. Los ejemplos sintéticos no provocan inevitablemente un colapso; la sustitución indiscriminada y la generación repetida requieren un examen especialmente cuidadoso.
Entrena con y sin el subconjunto sintético usando el mismo presupuesto. Consérvalo si mejora la calidad en datos reales reservados sin empeoramientos inaceptables, sobre todo en los casos poco frecuentes.
La sección sobre datos sintéticos de la guía de ingeniería de LLM explica los principales enfoques de generación.