Kiedy dekodowanie spekulatywne przyspiesza obsługę LLM?

Tłumaczenie automatyczne

Ten artykuł został automatycznie przetłumaczony z angielskiego oryginału.

Dekodowanie spekulatywne może przyspieszyć generowanie, gdy proponowanie kilku tokenów kandydujących jest tanie, a model docelowy akceptuje ich dostatecznie dużo. Model docelowy weryfikuje kandydatów razem, dzięki czemu może zwrócić kilka tokenów wyjściowych w jednej rundzie. Dodatkowa praca związana z propozycjami może jednak spowolnić obsługę, gdy akceptacja jest niska lub model docelowy już działa wydajnie na dużych partiach.

Zanim wybierzesz tę metodę dla usługi, zmierz cały cykl generowania, łącznie z proponowaniem i odrzucaniem kandydatów.

Zrozum rundę weryfikacji

Model proponujący zgłasza K tokenów. Model docelowy ocenia pozycje kandydatów w jednym przebiegu w przód dla całej partii. Zmodyfikowane próbkowanie z odrzucaniem akceptuje kandydatów od lewej do prawej, korzystając z obu rozkładów. Po pierwszym odrzuceniu losuje korektę z resztowego rozkładu modelu docelowego i odrzuca dalszych kandydatów. Jeśli wszyscy kandydaci zostaną zaakceptowani, może też wylosować jeden dodatkowy token modelu docelowego.

Algorytm próbkowania spekulatywnego Chen i współautorów zachowuje rozkład docelowy przy założeniach algorytmu, z uwzględnieniem ograniczeń numerycznych sprzętu. Samo porównywanie tokenów kandydujących z tokenami wybranymi przez model docelowy nie jest tym samym algorytmem próbkowania. Sprawdź zachowanie próbkowania i obsługiwane ustawienia wybranej implementacji.

Artykuł podaje przyspieszenie dekodowania 2–2.5x dla badanego modelu docelowego Chinchilla-70B z modelem proponującym 4B, partią o rozmiarze jeden i K=4 na TPU v4. Ten historyczny wynik pokazuje, że mechanizm może pomóc, ale nie prognozuje wydajności innej pary modeli.

Sprawdź, co decyduje o zysku

MiaraInterpretacja
Zaakceptowane tokeny na rundę weryfikacjiIle wyników amortyzuje koszt wykonania modelu docelowego
Czas proponowaniaKoszt zgłaszania kandydatów
Czas weryfikacji i korektyPraca modelu docelowego i narzut związany z odrzuconymi kandydatami
Przepustowość i opóźnienie zależnie od współbieżnościCzy zysk utrzymuje się przy realistycznych partiach
Jakość wykonania zadań i ustawienia próbkowaniaCzy wybrana metoda zachowuje zamierzone działanie

Metody z modelem proponującym to jedna z opcji. EAGLE-3 łączy kilka poziomów cech modelu docelowego i bezpośrednio przewiduje proponowane tokeny; inne podejścia wykorzystują dodatkowe głowice predykcyjne lub dopasowywanie do promptu. Ich współczynniki akceptacji i koszty wykonania są różne.

Przetestuj reprezentatywny kod, prozę, ustrukturyzowane dane wyjściowe i długości kontekstu. Zacznij od małej liczby proponowanych tokenów, a następnie zmieniaj ją wraz ze współbieżnością. Więcej kandydatów nie pomaga, jeśli koszt ich proponowania i weryfikacji przekracza oszczędzoną pracę.

Przewodnik inżynierski: dekodowanie spekulatywne wyjaśnia kolejność akceptacji i warianty metody.