Synthetische trainingsdata: hoe genereer ik bruikbare voorbeelden?

Automatische vertaling

Dit artikel is automatisch vertaald vanuit de oorspronkelijke Engelse versie.

Genereer synthetische voorbeelden om specifieke tekortkomingen in echte trainingsdata aan te pakken. Begin met beoordeelde gevallen, varieer de invoer bewust, controleer de uitvoer en test het resulterende model op echte voorbeelden die apart zijn gehouden. Een grotere gegenereerde dataset is alleen nuttig als die de taak die je meet verbetert.

Gebruik synthetische data voor dekking die je kunt controleren, zoals ontbrekende labels, zeldzame formaten of voorbeelden met bekende antwoorden.

Bepaal wat elk gegenereerd voorbeeld toevoegt

Benoem bij een extractietaak eerst het veld en de fout die je wilt afdekken:

Werkelijke foutVoorgestelde gegenereerde variatieControle van de uitvoer
Een ontbrekend veld leidt tot een verzonnen waardeVerwijder dat veld uit verder geldige documentenHet verwachte veld is leeg
Een andere veldvolgorde verstoort de extractieWijzig de indeling en behoud de waardenDe waarden komen nog steeds overeen met de bron
Een zeldzaam label wordt verkeerd geclassificeerdGenereer uiteenlopende gevallen voor dat beoordeelde labelHet label doorstaat de beoordeling

Bewaar het brongeval, de generatieprompt, de identiteit van het teacher model en het validatieresultaat. Zo kun je een deelverzameling verwijderen of opnieuw genereren wanneer een regel voor het toekennen van labels verandert.

Self-Instruct genereert en filtert instructievoorbeelden op basis van een startverzameling. Het technische rapport van Phi-4 beschrijft uitgebreidere methoden voor generatie, kritiek, herziening en instructieomkering. Dit zijn opties om data te produceren; de gepubliceerde resultaten bevestigen niet de kwaliteit van jouw voorbeelden.

Filter voordat je de hoeveelheid vergroot

Controleer duplicaten, antwoorden zonder onderbouwing, de labelverdeling, de taal en de moeilijkheid van de taak. Gebruik deterministische controles als het juiste resultaat bekend is en menselijke beoordeling als dat niet zo is. Houd evaluatiegevallen buiten de generatieprompts en trainingsdata.

Recursief trainen op gegenereerde data kan zeldzame patronen doen verdwijnen. Het onderzoek naar model collapse onderzoekt dit risico. Een afzonderlijk onderzoek naar het verzamelen van echte en synthetische data laat zien dat de strategie voor het bewaren van data de uitkomst verandert. Synthetische voorbeelden veroorzaken niet onvermijdelijk een instorting; ongerichte vervanging en herhaalde generatie vereisen extra zorgvuldig onderzoek.

Train met en zonder de synthetische deelverzameling binnen hetzelfde budget. Behoud die als de kwaliteit op echte, apart gehouden data verbetert zonder onaanvaardbare achteruitgang, vooral bij zeldzame gevallen.

Het onderdeel over synthetische data in de LLM Engineering Guide legt de belangrijkste generatiebenaderingen uit.