Syntetyczne dane treningowe: jak generować przydatne przykłady?
Tłumaczenie automatyczne
Ten artykuł został automatycznie przetłumaczony z angielskiego oryginału.
Generuj syntetyczne przykłady, aby uzupełnić konkretne braki w rzeczywistych danych treningowych. Zacznij od zweryfikowanych przypadków, celowo zmieniaj dane wejściowe, sprawdzaj wyniki i testuj uzyskany model na rzeczywistych przykładach odłożonych do ewaluacji. Większy wygenerowany zbiór danych jest przydatny tylko wtedy, gdy poprawia wyniki mierzonego zadania.
Używaj danych syntetycznych do rozszerzania pokrycia, które możesz sprawdzić, na przykład brakujących etykiet, rzadkich formatów lub przykładów ze znanymi odpowiedziami.
Określ, co wnosi każdy wygenerowany przykład
W zadaniu ekstrakcji najpierw wskaż pole i błąd, które musisz uwzględnić:
| Rzeczywisty błąd | Proponowany wygenerowany wariant | Sprawdzenie wyniku |
|---|---|---|
| Brak pola powoduje wymyślenie wartości | Usuń to pole z dokumentów, które poza tym są poprawne | Oczekiwane pole jest puste |
| Zmieniona kolejność pól zakłóca ekstrakcję | Zmień układ, zachowując wartości | Wartości nadal odpowiadają źródłu |
| Rzadka etykieta jest błędnie klasyfikowana | Generuj różnorodne przypadki dla tej zweryfikowanej etykiety | Etykieta przechodzi weryfikację |
Zachowaj przypadek źródłowy, prompt generowania, tożsamość modelu nauczyciela i wynik walidacji. Pozwoli to usunąć lub ponownie wygenerować podzbiór, gdy zmieni się reguła etykietowania.
Self-Instruct generuje i filtruje przykłady instrukcji na podstawie zbioru początkowego. Raport techniczny Phi-4 opisuje bardziej złożone metody generowania, krytyki, poprawiania i odwracania instrukcji. Są to sposoby tworzenia danych; ich opublikowane wyniki nie potwierdzają jakości twoich przykładów.
Filtruj, zanim zwiększysz liczbę przykładów
Sprawdź duplikaty, odpowiedzi bez uzasadnienia, równowagę etykiet, język i trudność zadania. Korzystaj z deterministycznych weryfikatorów, gdy znany jest poprawny wynik, a z oceny człowieka, gdy nie jest znany. Nie umieszczaj przypadków ewaluacyjnych w promptach generowania ani w danych treningowych.
Rekurencyjne trenowanie na wygenerowanych danych może prowadzić do utraty rzadkich wzorców. Badanie zapadania się modeli analizuje to ryzyko. Osobne badanie gromadzenia rzeczywistych i syntetycznych danych pokazuje, że strategia zachowywania danych zmienia wynik. Syntetyczne przykłady nie prowadzą nieuchronnie do zapadania się modelu; bezkrytyczne zastępowanie danych i wielokrotne generowanie wymagają szczególnie uważnej analizy.
Trenuj z syntetycznym podzbiorem i bez niego, przy tym samym budżecie. Zachowaj go, gdy jakość na rzeczywistych danych odłożonych do ewaluacji poprawia się bez niedopuszczalnego pogorszenia wyników, zwłaszcza w rzadkich przypadkach.
Sekcja o danych syntetycznych w przewodniku po inżynierii LLM wyjaśnia główne podejścia do generowania.