Données d’entraînement synthétiques : comment générer des exemples utiles ?

Traduction automatique

Cet article a été traduit automatiquement depuis la version originale en anglais.

Générez des exemples synthétiques pour combler des lacunes précises dans les données d’entraînement réelles. Partez de cas vérifiés, variez délibérément les entrées, vérifiez les sorties et testez le modèle obtenu sur des exemples réels réservés à l’évaluation. Un dataset généré plus volumineux n’est utile que s’il améliore la tâche que vous mesurez.

Utilisez les données synthétiques pour étendre une couverture que vous pouvez vérifier, par exemple des étiquettes manquantes, des formats rares ou des exemples dont les réponses sont connues.

Définissez ce qu’apporte chaque exemple généré

Pour une tâche d’extraction, commencez par identifier le champ et l’erreur que vous devez couvrir :

Erreur réelleVariation générée proposéeVérification de la sortie
Un champ manquant entraîne une valeur inventéeSupprimer ce champ dans des documents par ailleurs validesLe champ attendu est vide
Le réordonnancement des champs perturbe l’extractionModifier la mise en page en conservant les valeursLes valeurs correspondent toujours à la source
Une étiquette rare est mal classéeGénérer des cas variés pour cette étiquette vérifiéeL’étiquette est validée lors de la vérification

Conservez le cas source, le prompt de génération, l’identité du modèle enseignant et le résultat de la validation. Vous pourrez ainsi supprimer ou régénérer un sous-ensemble lorsqu’une règle d’étiquetage change.

Self-Instruct génère et filtre des exemples d’instructions à partir d’un ensemble initial. Le rapport technique de Phi-4 décrit des méthodes plus élaborées de génération, de critique, de révision et d’inversion d’instructions. Ce sont des options pour produire des données ; leurs résultats publiés ne certifient pas vos exemples.

Filtrez avant d’augmenter le volume

Vérifiez les doublons, les réponses non étayées, l’équilibre des étiquettes, la langue et la difficulté de la tâche. Utilisez des vérificateurs déterministes lorsque le résultat correct est connu, et une vérification humaine lorsqu’il ne l’est pas. Excluez les cas d’évaluation des prompts de génération et des données d’entraînement.

L’entraînement récursif sur des données générées peut faire disparaître des motifs rares. L’étude sur l’effondrement des modèles examine ce risque. Une autre étude sur l’accumulation de données réelles et synthétiques montre que la stratégie de conservation des données modifie le résultat. Les exemples synthétiques ne provoquent pas inévitablement un effondrement ; le remplacement indiscriminé et la génération répétée nécessitent un examen particulièrement attentif.

Entraînez le modèle avec et sans le sous-ensemble synthétique, avec le même budget. Conservez ce sous-ensemble si la qualité s’améliore sur les données réelles réservées sans régressions inacceptables, notamment sur les cas rares.

La section sur les données synthétiques du guide d’ingénierie des LLM explique les principales approches de génération.