Co ograniczają okna kontekstowe LLM i jak RoPE je rozszerza
Tłumaczenie automatyczne
Ten artykuł został automatycznie przetłumaczony z angielskiego oryginału.
Okno kontekstowe LLM ogranicza sekwencję tokenów dostępną dla żądania generowania. API może określać oddzielne limity wejścia i wyjścia albo limit łączny. Nie jest to po prostu liczba tokenów przetwarzanych w jednym przebiegu w przód: wstępne przetwarzanie w blokach i dekodowanie z pamięcią podręczną mogą przetwarzać sekwencję stopniowo.
Inżynierowie pracujący z długimi dokumentami muszą sprawdzić zarówno limity długości sekwencji modelu, jak i to, czy model niezawodnie wykorzystuje potrzebne informacje.
Czytaj opublikowane nazwy pól
Według dokumentacji tych konkretnych modeli:
| Model | Opublikowany limit | Oddzielny maksymalny rozmiar wyjścia |
|---|---|---|
| GPT-4.1 | Okno kontekstowe o długości 1,047,576 tokenów | 32,768 tokenów |
| Gemini 2.5 Pro | 1,048,576 tokenów wejściowych | 65,536 tokenów |
Specyfikacje GPT-4.1 i Gemini 2.5 Pro używają różnych nazw. Nie traktuj tych liczb jako identycznych zasad dotyczących łącznego budżetu. Zastosuj aktualne limity wybranego API do zserializowanego żądania, uwzględniając instrukcje, narzędzia, historię i treści multimodalne, jeśli występują.
W przypadku modelu z łącznym limitem wejścia i wyjścia zarezerwuj miejsce na wyjście przed dopuszczeniem promptu. Długie konteksty zwiększają też zużycie pamięci przez konwencjonalny KV cache. Obsługiwany limit długości sekwencji nie dowodzi, że GPU ma wystarczająco dużo pamięci przy wymaganej liczbie równoczesnych żądań.
Co zmieniają metody uwzględniania pozycji
Mechanizm uwagi potrzebuje informacji o pozycji, aby rozróżniać kolejność tokenów i odległości między nimi. RoPE obraca wektory zapytań i kluczy o kąty zależne od pozycji, dzięki czemu ich iloczyny skalarne zależą zarówno od pozycji względnych, jak i od treści. Maska przyczynowa ogranicza widoczność przyszłych tokenów; nie jest tym samym co jawne kodowanie pozycji względnych.
ALiBi zamiast tego dodaje do wyników mechanizmu uwagi składniki zależne od odległości. YaRN zmienia skalowanie częstotliwości RoPE i dostosowuje model do dłuższych kontekstów. Te metody sprawdzono w określonych warunkach. Sama zmiana ustawienia kontekstu lub współczynnika skalowania nie potwierdza niezawodnej ekstrapolacji dla dowolnego checkpointu.
Testuj wyszukiwanie informacji potwierdzających odpowiedź i dokładność wykonania zadania przy różnych długościach, uwzględniając fakty blisko początku, środka i końca. Mierz TTFT, opóźnienie kolejnych tokenów, szczytowe zużycie pamięci i zachowanie przy obcinaniu treści. Jeśli model przyjmuje żądanie, ale pomija potrzebne informacje, żądanie mieści się w limicie rozmiaru, lecz zadanie aplikacji nie zostało wykonane.
Poradnik inżynierski: okna kontekstowe i kodowanie pozycji wyjaśnia te metody i opisuje ich pierwotne eksperymenty.