Trening wstępny a fine-tuning: czym różnią się etapy treningu LLM?

Tłumaczenie automatyczne

Ten artykuł został automatycznie przetłumaczony z angielskiego oryginału.

Trening wstępny rozwija ogólne zdolności na podstawie dużego korpusu. Nadzorowany fine-tuning uczy model generowania oczekiwanych odpowiedzi na podstawie przykładów. Metody dostosowania do preferencji i celów uczą go zgodnie z preferencjami lub weryfikowalnymi nagrodami. Są to różne cele treningu; użyteczny model może przejść przez wszystkie trzy etapy.

Zacznij od zachowania, które trzeba zmienić. Brak dokumentu, powtarzający się błąd klasyfikacji i niebezpieczne działanie wymagają różnych interwencji.

Co zmienia się na każdym etapie?

EtapSygnał treningowyWynik do oceny
Trening wstępnyW autoregresyjnym LLM: przewidywanie kolejnego tokenu w tekście korpusuOgólne zdolności językowe i zdolność wykonywania zadań
Nadzorowany fine-tuning, czyli SFTPrzykłady danych wejściowych i oczekiwanych odpowiedziZachowanie przy zadaniu pokazanym w przykładach
Trening na podstawie preferencji lub nagródPary odpowiedzi ze wskazaną preferowaną odpowiedzią, wyuczone oceny lub kontrole oparte na regułachNagradzane zachowanie i niepożądane skutki uboczne

Raport techniczny Llama 3 odróżnia trening wstępny na dużą skalę od późniejszego treningu, który rozwija wykonywanie instrukcji i inne zdolności. Trening wstępny nie zawsze polega na przewidywaniu kolejnego tokenu: modele kodujące i modele usuwające szum mogą stosować inne cele.

SFT jest zwykle bardziej bezpośrednim punktem wyjścia, gdy sprawdzone przykłady pokazują oczekiwany wynik. Na przykład zbiór danych do ekstrakcji może łączyć dokument z poprawnymi polami. Trening na podstawie preferencji pasuje do porównań, takich jak ocena, która z dwóch odpowiedzi lepiej przestrzega zasad. DPO bezpośrednio optymalizuje pary preferencji, a tradycyjny proces RLHF trenuje model nagrody, po czym aktualizuje politykę za pomocą uczenia ze wzmocnieniem.

Wybierz metodę na podstawie zaobserwowanego błędu

Jeśli odpowiedzi wymagają zmiennych lub prywatnych informacji, najpierw dostarcz je przez wyszukiwanie. Jeśli model wielokrotnie używa błędnych etykiet mimo jasnego promptu, przetestuj SFT na sprawdzonych przykładach. Jeśli kilka akceptowalnych odpowiedzi różni się pod względem preferencji, którą potrafisz konsekwentnie oceniać, rozważ trening na podstawie preferencji.

Przy każdej zmianie zachowuj zbiór ewaluacyjny niewykorzystywany w treningu. Sprawdzaj docelowe zachowanie, pogorszenie wyników w ogólnych zadaniach, odmowy i koszt. Niższa strata treningowa nie dowodzi, że wdrożony system działa lepiej.

Wybór na poziomie aplikacji opisuje tekst fine-tuning a RAG a prompting. Sekcja o etapach treningu w Przewodniku po inżynierii LLM przedstawia szerszy kontekst.