Destylacja LLM: jak małe modele uczą się od nauczycieli?
Tłumaczenie automatyczne
Ten artykuł został automatycznie przetłumaczony z angielskiego oryginału.
Destylacja LLM polega na trenowaniu modelu ucznia za pomocą sygnałów wytwarzanych przez model nauczyciela. Metody oparte na logitach dopasowują rozkłady wyjściowe. Metody oparte na danych wykorzystują przykłady wygenerowane przez nauczyciela. Rozważ destylację, gdy mniejszy model może osiągnąć określony próg jakości dla zadania przy niższym koszcie obsługi.
Destylacja nie gwarantuje, że uczeń zachowa wszystkie umiejętności nauczyciela. Zakres danych i zadanie ewaluacyjne określają, co zostanie przeniesione.
Dwa sposoby przenoszenia zachowania
| Metoda | Informacje od nauczyciela | Główne wymaganie |
|---|---|---|
| Destylacja oparta na logitach | Prawdopodobieństwa tokenów lub logity | Dostęp do rozkładów i zgodny cel treningowy |
| Destylacja oparta na danych | Wygenerowane przykłady wejścia i wyjścia | Sprawdzone lub przefiltrowane przykłady i fine-tuning ucznia |
Nauczyciel dostępny wyłącznie przez API może umożliwić destylację opartą na danych, nawet jeśli nie udostępnia rozkładów wymaganych przez stosowaną metodę treningu na logitach. Różne tokenizatory lub architektury mogą utrudniać bezpośrednie dopasowanie rozkładów.
Raport DeepSeek-R1 opisuje fine-tuning mniejszych modeli Qwen i Llama na starannie dobranej mieszance około 800,000 przykładów. Destylowane modele osiągały dobre wyniki w benchmarkach rozumowania przedstawionych w publikacji. Te wyniki dowodzą, że transfer zadziałał w tej konfiguracji; nie pokazują, że mały uczeń może zastąpić dowolnego nauczyciela przy dowolnym obciążeniu.
Twórz przykłady dla mierzalnego zadania
W przypadku klasyfikatora pytań do pomocy technicznej podaj rzeczywiste typy pytań i poproś nauczyciela o zaproponowanie etykiet oraz wyjaśnień. Sprawdź etykiety według zweryfikowanej taksonomii; odrzuć nieuzasadnione klasyfikacje. Uwzględnij rzadkie klasy i niejednoznaczne przypadki zamiast tworzyć wiele prostych parafraz częstych zgłoszeń.
Oddziel przykłady treningowe wygenerowane przez nauczyciela od wydzielonego zbioru ewaluacyjnego. W przeciwnym razie uczeń może wydawać się skuteczny, ponieważ test ponownie wykorzystuje przykłady z treningu zamiast mierzyć wyniki na nieznanych przypadkach. Przed wygenerowaniem zbioru danych sprawdź, czy warunki korzystania z nauczyciela zezwalają na zamierzony sposób wykorzystania do treningu.
Porównaj ucznia zarówno z nauczycielem, jak i z jego własnym modelem bazowym bez dostrajania. Zmierz jakość wykonania zadania, rodzaje błędów, długość odpowiedzi, opóźnienie i koszt przy planowanej liczbie równoległych żądań. Przy szacowaniu oszczędności uwzględnij wywołania nauczyciela w ramach obsługi zastępczej.
Korzystaj z wyjaśnień nauczyciela tylko wtedy, gdy poprawiają mierzone zachowanie ucznia; dłuższe docelowe odpowiedzi treningowe kosztują też więcej podczas generowania i uczenia.
Sekcja o destylacji w LLM Engineering Guide opisuje opublikowane porównania R1 i ich ograniczenia.