Kiedy dekodowanie spekulatywne przyspiesza obsługę LLM?
Tłumaczenie automatyczne
Ten artykuł został automatycznie przetłumaczony z angielskiego oryginału.
Dekodowanie spekulatywne może przyspieszyć generowanie, gdy proponowanie kilku tokenów kandydujących jest tanie, a model docelowy akceptuje ich dostatecznie dużo. Model docelowy weryfikuje kandydatów razem, dzięki czemu może zwrócić kilka tokenów wyjściowych w jednej rundzie. Dodatkowa praca związana z propozycjami może jednak spowolnić obsługę, gdy akceptacja jest niska lub model docelowy już działa wydajnie na dużych partiach.
Zanim wybierzesz tę metodę dla usługi, zmierz cały cykl generowania, łącznie z proponowaniem i odrzucaniem kandydatów.
Zrozum rundę weryfikacji
Model proponujący zgłasza K tokenów. Model docelowy ocenia pozycje kandydatów w jednym przebiegu w przód dla całej partii. Zmodyfikowane próbkowanie z odrzucaniem akceptuje kandydatów od lewej do prawej, korzystając z obu rozkładów. Po pierwszym odrzuceniu losuje korektę z resztowego rozkładu modelu docelowego i odrzuca dalszych kandydatów. Jeśli wszyscy kandydaci zostaną zaakceptowani, może też wylosować jeden dodatkowy token modelu docelowego.
Algorytm próbkowania spekulatywnego Chen i współautorów zachowuje rozkład docelowy przy założeniach algorytmu, z uwzględnieniem ograniczeń numerycznych sprzętu. Samo porównywanie tokenów kandydujących z tokenami wybranymi przez model docelowy nie jest tym samym algorytmem próbkowania. Sprawdź zachowanie próbkowania i obsługiwane ustawienia wybranej implementacji.
Artykuł podaje przyspieszenie dekodowania 2–2.5x dla badanego modelu docelowego Chinchilla-70B z modelem proponującym 4B, partią o rozmiarze jeden i K=4 na TPU v4. Ten historyczny wynik pokazuje, że mechanizm może pomóc, ale nie prognozuje wydajności innej pary modeli.
Sprawdź, co decyduje o zysku
| Miara | Interpretacja |
|---|---|
| Zaakceptowane tokeny na rundę weryfikacji | Ile wyników amortyzuje koszt wykonania modelu docelowego |
| Czas proponowania | Koszt zgłaszania kandydatów |
| Czas weryfikacji i korekty | Praca modelu docelowego i narzut związany z odrzuconymi kandydatami |
| Przepustowość i opóźnienie zależnie od współbieżności | Czy zysk utrzymuje się przy realistycznych partiach |
| Jakość wykonania zadań i ustawienia próbkowania | Czy wybrana metoda zachowuje zamierzone działanie |
Metody z modelem proponującym to jedna z opcji. EAGLE-3 łączy kilka poziomów cech modelu docelowego i bezpośrednio przewiduje proponowane tokeny; inne podejścia wykorzystują dodatkowe głowice predykcyjne lub dopasowywanie do promptu. Ich współczynniki akceptacji i koszty wykonania są różne.
Przetestuj reprezentatywny kod, prozę, ustrukturyzowane dane wyjściowe i długości kontekstu. Zacznij od małej liczby proponowanych tokenów, a następnie zmieniaj ją wraz ze współbieżnością. Więcej kandydatów nie pomaga, jeśli koszt ich proponowania i weryfikacji przekracza oszczędzoną pracę.
Przewodnik inżynierski: dekodowanie spekulatywne wyjaśnia kolejność akceptacji i warianty metody.