Synthetische Trainingsdaten: Wie generiere ich nützliche Beispiele?
Automatische Übersetzung
Dieser Artikel wurde automatisch aus der englischen Originalversion übersetzt.
Generiere synthetische Beispiele, um konkrete Lücken in realen Trainingsdaten zu schließen. Beginne mit geprüften Fällen, variiere die Eingaben gezielt, überprüfe die Ausgaben und teste das daraus entstandene Model auf realen, zurückgehaltenen Beispielen. Ein größeres generiertes Dataset ist nur dann nützlich, wenn es die gemessene Aufgabenleistung verbessert.
Nutze synthetische Daten für eine Abdeckung, die du überprüfen kannst, etwa für fehlende Labels, seltene Formate oder Beispiele mit bekannten Antworten.
Definiere, was jedes generierte Beispiel ergänzt
Benenne bei einer Extraktionsaufgabe zuerst das Feld und den Fehler, den du abdecken musst:
| Realer Fehler | Vorgeschlagene generierte Variante | Prüfung der Ausgabe |
|---|---|---|
| Ein fehlendes Feld führt zu einem erfundenen Wert | Entferne dieses Feld aus ansonsten gültigen Dokumenten | Das erwartete Feld ist leer |
| Eine geänderte Feldreihenfolge stört die Extraktion | Ändere das Layout und behalte die Werte bei | Die Werte stimmen weiterhin mit der Quelle überein |
| Ein seltenes Label wird falsch klassifiziert | Generiere vielfältige Fälle für dieses geprüfte Label | Das Label besteht die Prüfung |
Bewahre den Ausgangsfall, den Generierungs-Prompt, die Identität des Teacher-Models und das Validierungsergebnis auf. So kannst du eine Teilmenge entfernen oder neu generieren, wenn sich eine Regel zur Vergabe von Labels ändert.
Self-Instruct generiert und filtert Instruktionsbeispiele aus einem Ausgangssatz. Der technische Bericht zu Phi-4 beschreibt aufwendigere Methoden zur Generierung, Kritik, Überarbeitung und Instruktionsumkehr. Diese Methoden bieten Möglichkeiten zur Datenerzeugung; ihre veröffentlichten Ergebnisse bestätigen nicht die Qualität deiner Beispiele.
Filtere, bevor du die Datenmenge erhöhst
Prüfe Duplikate, unbelegte Antworten, die Verteilung der Labels, die Sprache und den Schwierigkeitsgrad der Aufgabe. Nutze deterministische Prüfer, wenn das korrekte Ergebnis bekannt ist, und menschliche Prüfung, wenn es nicht bekannt ist. Halte Evaluationsfälle aus den Generierungs-Prompts und Trainingsdaten heraus.
Rekursives Training mit generierten Daten kann zum Verlust seltener Muster führen. Die Studie zum Model Collapse untersucht dieses Risiko. Eine separate Studie zum Ansammeln realer und synthetischer Daten zeigt, dass die Strategie zur Aufbewahrung von Daten das Ergebnis verändert. Synthetische Beispiele führen nicht zwangsläufig zu einem Kollaps; wahlloser Austausch und wiederholte Generierung müssen besonders sorgfältig geprüft werden.
Trainiere mit und ohne die synthetische Teilmenge unter demselben Budget. Behalte sie bei, wenn sich die Qualität auf realen, zurückgehaltenen Daten ohne unvertretbare Verschlechterungen verbessert, insbesondere bei seltenen Fällen.
Der Abschnitt zu synthetischen Daten im LLM Engineering Guide erklärt die wichtigsten Generierungsansätze.