Synthetische Trainingsdaten: Wie generiere ich nützliche Beispiele?

Automatische Übersetzung

Dieser Artikel wurde automatisch aus der englischen Originalversion übersetzt.

Generiere synthetische Beispiele, um konkrete Lücken in realen Trainingsdaten zu schließen. Beginne mit geprüften Fällen, variiere die Eingaben gezielt, überprüfe die Ausgaben und teste das daraus entstandene Model auf realen, zurückgehaltenen Beispielen. Ein größeres generiertes Dataset ist nur dann nützlich, wenn es die gemessene Aufgabenleistung verbessert.

Nutze synthetische Daten für eine Abdeckung, die du überprüfen kannst, etwa für fehlende Labels, seltene Formate oder Beispiele mit bekannten Antworten.

Definiere, was jedes generierte Beispiel ergänzt

Benenne bei einer Extraktionsaufgabe zuerst das Feld und den Fehler, den du abdecken musst:

Realer FehlerVorgeschlagene generierte VariantePrüfung der Ausgabe
Ein fehlendes Feld führt zu einem erfundenen WertEntferne dieses Feld aus ansonsten gültigen DokumentenDas erwartete Feld ist leer
Eine geänderte Feldreihenfolge stört die ExtraktionÄndere das Layout und behalte die Werte beiDie Werte stimmen weiterhin mit der Quelle überein
Ein seltenes Label wird falsch klassifiziertGeneriere vielfältige Fälle für dieses geprüfte LabelDas Label besteht die Prüfung

Bewahre den Ausgangsfall, den Generierungs-Prompt, die Identität des Teacher-Models und das Validierungsergebnis auf. So kannst du eine Teilmenge entfernen oder neu generieren, wenn sich eine Regel zur Vergabe von Labels ändert.

Self-Instruct generiert und filtert Instruktionsbeispiele aus einem Ausgangssatz. Der technische Bericht zu Phi-4 beschreibt aufwendigere Methoden zur Generierung, Kritik, Überarbeitung und Instruktionsumkehr. Diese Methoden bieten Möglichkeiten zur Datenerzeugung; ihre veröffentlichten Ergebnisse bestätigen nicht die Qualität deiner Beispiele.

Filtere, bevor du die Datenmenge erhöhst

Prüfe Duplikate, unbelegte Antworten, die Verteilung der Labels, die Sprache und den Schwierigkeitsgrad der Aufgabe. Nutze deterministische Prüfer, wenn das korrekte Ergebnis bekannt ist, und menschliche Prüfung, wenn es nicht bekannt ist. Halte Evaluationsfälle aus den Generierungs-Prompts und Trainingsdaten heraus.

Rekursives Training mit generierten Daten kann zum Verlust seltener Muster führen. Die Studie zum Model Collapse untersucht dieses Risiko. Eine separate Studie zum Ansammeln realer und synthetischer Daten zeigt, dass die Strategie zur Aufbewahrung von Daten das Ergebnis verändert. Synthetische Beispiele führen nicht zwangsläufig zu einem Kollaps; wahlloser Austausch und wiederholte Generierung müssen besonders sorgfältig geprüft werden.

Trainiere mit und ohne die synthetische Teilmenge unter demselben Budget. Behalte sie bei, wenn sich die Qualität auf realen, zurückgehaltenen Daten ohne unvertretbare Verschlechterungen verbessert, insbesondere bei seltenen Fällen.

Der Abschnitt zu synthetischen Daten im LLM Engineering Guide erklärt die wichtigsten Generierungsansätze.