Syntetyczne dane treningowe: jak generować przydatne przykłady?

Tłumaczenie automatyczne

Ten artykuł został automatycznie przetłumaczony z angielskiego oryginału.

Generuj syntetyczne przykłady, aby uzupełnić konkretne braki w rzeczywistych danych treningowych. Zacznij od zweryfikowanych przypadków, celowo zmieniaj dane wejściowe, sprawdzaj wyniki i testuj uzyskany model na rzeczywistych przykładach odłożonych do ewaluacji. Większy wygenerowany zbiór danych jest przydatny tylko wtedy, gdy poprawia wyniki mierzonego zadania.

Używaj danych syntetycznych do rozszerzania pokrycia, które możesz sprawdzić, na przykład brakujących etykiet, rzadkich formatów lub przykładów ze znanymi odpowiedziami.

Określ, co wnosi każdy wygenerowany przykład

W zadaniu ekstrakcji najpierw wskaż pole i błąd, które musisz uwzględnić:

Rzeczywisty błądProponowany wygenerowany wariantSprawdzenie wyniku
Brak pola powoduje wymyślenie wartościUsuń to pole z dokumentów, które poza tym są poprawneOczekiwane pole jest puste
Zmieniona kolejność pól zakłóca ekstrakcjęZmień układ, zachowując wartościWartości nadal odpowiadają źródłu
Rzadka etykieta jest błędnie klasyfikowanaGeneruj różnorodne przypadki dla tej zweryfikowanej etykietyEtykieta przechodzi weryfikację

Zachowaj przypadek źródłowy, prompt generowania, tożsamość modelu nauczyciela i wynik walidacji. Pozwoli to usunąć lub ponownie wygenerować podzbiór, gdy zmieni się reguła etykietowania.

Self-Instruct generuje i filtruje przykłady instrukcji na podstawie zbioru początkowego. Raport techniczny Phi-4 opisuje bardziej złożone metody generowania, krytyki, poprawiania i odwracania instrukcji. Są to sposoby tworzenia danych; ich opublikowane wyniki nie potwierdzają jakości twoich przykładów.

Filtruj, zanim zwiększysz liczbę przykładów

Sprawdź duplikaty, odpowiedzi bez uzasadnienia, równowagę etykiet, język i trudność zadania. Korzystaj z deterministycznych weryfikatorów, gdy znany jest poprawny wynik, a z oceny człowieka, gdy nie jest znany. Nie umieszczaj przypadków ewaluacyjnych w promptach generowania ani w danych treningowych.

Rekurencyjne trenowanie na wygenerowanych danych może prowadzić do utraty rzadkich wzorców. Badanie zapadania się modeli analizuje to ryzyko. Osobne badanie gromadzenia rzeczywistych i syntetycznych danych pokazuje, że strategia zachowywania danych zmienia wynik. Syntetyczne przykłady nie prowadzą nieuchronnie do zapadania się modelu; bezkrytyczne zastępowanie danych i wielokrotne generowanie wymagają szczególnie uważnej analizy.

Trenuj z syntetycznym podzbiorem i bez niego, przy tym samym budżecie. Zachowaj go, gdy jakość na rzeczywistych danych odłożonych do ewaluacji poprawia się bez niedopuszczalnego pogorszenia wyników, zwłaszcza w rzadkich przypadkach.

Sekcja o danych syntetycznych w przewodniku po inżynierii LLM wyjaśnia główne podejścia do generowania.