Synthetische trainingsdata: hoe genereer ik bruikbare voorbeelden?
Automatische vertaling
Dit artikel is automatisch vertaald vanuit de oorspronkelijke Engelse versie.
Genereer synthetische voorbeelden om specifieke tekortkomingen in echte trainingsdata aan te pakken. Begin met beoordeelde gevallen, varieer de invoer bewust, controleer de uitvoer en test het resulterende model op echte voorbeelden die apart zijn gehouden. Een grotere gegenereerde dataset is alleen nuttig als die de taak die je meet verbetert.
Gebruik synthetische data voor dekking die je kunt controleren, zoals ontbrekende labels, zeldzame formaten of voorbeelden met bekende antwoorden.
Bepaal wat elk gegenereerd voorbeeld toevoegt
Benoem bij een extractietaak eerst het veld en de fout die je wilt afdekken:
| Werkelijke fout | Voorgestelde gegenereerde variatie | Controle van de uitvoer |
|---|---|---|
| Een ontbrekend veld leidt tot een verzonnen waarde | Verwijder dat veld uit verder geldige documenten | Het verwachte veld is leeg |
| Een andere veldvolgorde verstoort de extractie | Wijzig de indeling en behoud de waarden | De waarden komen nog steeds overeen met de bron |
| Een zeldzaam label wordt verkeerd geclassificeerd | Genereer uiteenlopende gevallen voor dat beoordeelde label | Het label doorstaat de beoordeling |
Bewaar het brongeval, de generatieprompt, de identiteit van het teacher model en het validatieresultaat. Zo kun je een deelverzameling verwijderen of opnieuw genereren wanneer een regel voor het toekennen van labels verandert.
Self-Instruct genereert en filtert instructievoorbeelden op basis van een startverzameling. Het technische rapport van Phi-4 beschrijft uitgebreidere methoden voor generatie, kritiek, herziening en instructieomkering. Dit zijn opties om data te produceren; de gepubliceerde resultaten bevestigen niet de kwaliteit van jouw voorbeelden.
Filter voordat je de hoeveelheid vergroot
Controleer duplicaten, antwoorden zonder onderbouwing, de labelverdeling, de taal en de moeilijkheid van de taak. Gebruik deterministische controles als het juiste resultaat bekend is en menselijke beoordeling als dat niet zo is. Houd evaluatiegevallen buiten de generatieprompts en trainingsdata.
Recursief trainen op gegenereerde data kan zeldzame patronen doen verdwijnen. Het onderzoek naar model collapse onderzoekt dit risico. Een afzonderlijk onderzoek naar het verzamelen van echte en synthetische data laat zien dat de strategie voor het bewaren van data de uitkomst verandert. Synthetische voorbeelden veroorzaken niet onvermijdelijk een instorting; ongerichte vervanging en herhaalde generatie vereisen extra zorgvuldig onderzoek.
Train met en zonder de synthetische deelverzameling binnen hetzelfde budget. Behoud die als de kwaliteit op echte, apart gehouden data verbetert zonder onaanvaardbare achteruitgang, vooral bij zeldzame gevallen.
Het onderdeel over synthetische data in de LLM Engineering Guide legt de belangrijkste generatiebenaderingen uit.