Was LLM Context Windows begrenzen und wie RoPE sie erweitert
Automatische Übersetzung
Dieser Artikel wurde automatisch aus der englischen Originalversion übersetzt.
Ein LLM Context Window begrenzt die Token-Sequenz, die einer Generierungsanfrage zur Verfügung steht. Eine API kann getrennte Grenzen für Eingabe und Ausgabe oder eine gemeinsame Grenze festlegen. Es ist nicht einfach die Anzahl der Tokens, die in einem einzigen Forward Pass verarbeitet werden: Chunked Prefill und Decoding mit Cache können die Sequenz schrittweise verarbeiten.
Ingenieure, die lange Dokumente verarbeiten, müssen sowohl die Sequenzgrenzen des Models prüfen als auch, ob es die benötigten Informationen zuverlässig nutzt.
Die veröffentlichten Feldnamen lesen
Für diese konkreten Models sind folgende Grenzen dokumentiert:
| Model | Veröffentlichte Grenze | Separates Ausgabemaximum |
|---|---|---|
| GPT-4.1 | Context Window mit 1,047,576 Tokens | 32,768 Tokens |
| Gemini 2.5 Pro | 1,048,576 Eingabe-Tokens | 65,536 Tokens |
Die Spezifikationen von GPT-4.1 und Gemini 2.5 Pro verwenden unterschiedliche Bezeichnungen. Behandeln Sie diese Zahlen nicht als identische Regeln für ein gemeinsames Token-Budget. Wenden Sie die aktuellen Grenzen der gewählten API auf die serialisierte Anfrage an, einschließlich Anweisungen, Tools, Verlauf und gegebenenfalls multimodaler Inhalte.
Bei einem Model mit einer gemeinsamen Eingabe-/Ausgabegrenze müssen Sie Platz für die Ausgabe reservieren, bevor Sie den Prompt zulassen. Lange Kontexte erhöhen außerdem den Speicherbedarf herkömmlicher KV caches. Eine unterstützte Sequenzgrenze belegt nicht, dass Ihre GPU bei der erforderlichen Anzahl gleichzeitiger Anfragen genügend Speicher hat.
Was Positionsmethoden ändern
Attention benötigt Positionsinformationen, um die Reihenfolge und den Abstand von Tokens zu unterscheiden. RoPE dreht Query- und Key-Vektoren um positionsabhängige Winkel. Dadurch hängen ihre Skalarprodukte sowohl von relativen Positionen als auch vom Inhalt ab. Eine kausale Maske beschränkt die Sichtbarkeit zukünftiger Tokens; sie ist nicht dasselbe wie eine explizite Kodierung relativer Positionen.
ALiBi addiert stattdessen abstandsabhängige Bias-Werte zu den Attention-Scores. YaRN verändert die Frequenzskalierung von RoPE und passt ein Model an längere Kontexte an. Diese Methoden wurden unter bestimmten Bedingungen getestet. Allein das Ändern einer Kontexteinstellung oder eines Skalierungsfaktors belegt keine zuverlässige Extrapolation für einen beliebigen Checkpoint.
Testen Sie Retrieval relevanter Belege und die Genauigkeit der Aufgabenbearbeitung bei unterschiedlichen Längen, einschließlich Fakten am Anfang, in der Mitte und am Ende. Messen Sie TTFT, die Latency späterer Tokens, den maximalen Speicherbedarf und das Verhalten bei Kürzungen. Wenn das Model die Anfrage akzeptiert, aber notwendige Belege übersieht, liegt die Anfrage innerhalb einer Größengrenze, doch die Anwendungsaufgabe ist gescheitert.
Der Engineering-Leitfaden: Context Windows und Positionskodierungen erläutert die Methoden und ihre ursprünglichen Experimente.