Skalowanie Chinchilla: czy dłuższe trenowanie obniża koszt LLM?

Tłumaczenie automatyczne

Ten artykuł został automatycznie przetłumaczony z angielskiego oryginału.

Skalowanie Chinchilla szacuje, jak podzielić stały budżet obliczeniowy na trening między rozmiar modelu a liczbę tokenów treningowych. Nie minimalizuje całkowitego kosztu modelu przez cały okres obsługi zapytań. Mniejszy model trenowany dłużej może kosztować więcej podczas treningu i mniej podczas obsługi zapytań, jeśli spełnia ten sam wymóg jakości.

Przewidywana liczba operacji inferencji zmienia to, które inwestycje w trening mogą się zwrócić.

Co oznacza proporcja 20 tokenów

W pracy o Chinchilla wytrenowano model z 70B parametrów na 1.4 biliona tokenów. To 20 tokenów treningowych na parametr. Analiza skalowania wykazała, że przy badanych założeniach rozmiar modelu i ilość danych treningowych powinny rosnąć razem, aby efektywnie wykorzystywać obliczenia treningowe.

Traktuj 20:1 jako przybliżony punkt z tej analizy, a nie wymóg dla każdej architektury, zbioru danych czy wdrożenia. Jakość danych, powtarzane przykłady, metody treningu i zadanie docelowe zmieniają to, co dają dodatkowe tokeny.

Raport Llama 3 opisuje trenowanie mniejszych modeli na znacznie większej liczbie tokenów na parametr. Wynika to z innego celu ekonomicznego: poprawy mniejszego modelu, którego inferencja może być wykonywana wiele razy po zakończeniu treningu. Wyższa proporcja nie mnoży jakości ani nie oznacza, że każdy dodatkowy token zwraca swój koszt.

Porównaj całkowity koszt przy wymaganej jakości

Przydatne oszacowanie obejmuje trening, przewidywaną inferencję i koszty operacyjne. Załóżmy, że dwa modele spełniają ten sam próg jakości dla zadania:

KandydatJednorazowy koszt treninguKoszt obsługi jednego zapytania
Większy model, krótszy treningNiższy w tym przykładzieWyższy
Mniejszy model, dłuższy treningWyższy w tym przykładzieNiższy

Mniejszy model zwraca dodatkowy wydatek na trening dopiero po wystarczającej liczbie zapytań. Podziel jego dodatkowy koszt treningu przez oszczędność na jednym zapytaniu, aby oszacować tę liczbę. Uwzględnij ewaluację, aktualizacje modelu i prace nad infrastrukturą, zanim użyjesz tego oszacowania do podjęcia decyzji zakupowej.

Mierz jakość i koszt obsługi zapytań przy tym samym rozkładzie danych wejściowych i długości odpowiedzi. Jeśli mniejszy model wymaga ponownych prób, użycia mocniejszego modelu w razie niepowodzenia lub dłuższych odpowiedzi, uwzględnij także te koszty.

Sekcja o prawach skalowania w LLM Engineering Guide porównuje opublikowane proporcje tokenów treningowych do parametrów i rozróżnia oba cele.