Wat LLM context windows beperken en hoe RoPE ze uitbreidt

Automatische vertaling

Dit artikel is automatisch vertaald vanuit de oorspronkelijke Engelse versie.

Een LLM context window begrenst de tokensequentie die beschikbaar is voor een generatieverzoek. Een API kan afzonderlijke invoer- en uitvoerlimieten of een gecombineerde limiet opgeven. Het is niet simpelweg het aantal tokens dat in één forward pass wordt verwerkt: prefill in chunks en decoding met cache kunnen de sequentie stapsgewijs verwerken.

Ingenieurs die lange documenten verwerken, moeten zowel de sequentielimieten van het model controleren als nagaan of het de benodigde informatie betrouwbaar gebruikt.

Lees de gepubliceerde veldnamen

Volgens de documentatie voor deze specifieke models:

ModelGepubliceerde limietAfzonderlijke maximale uitvoer
GPT-4.1context window van 1,047,576 tokens32,768 tokens
Gemini 2.5 Pro1,048,576 invoertokens65,536 tokens

De specificaties van GPT-4.1 en Gemini 2.5 Pro gebruiken verschillende labels. Behandel die getallen niet als identieke regels voor een gecombineerd budget. Pas de huidige limieten van de gekozen API toe op het geserialiseerde verzoek, inclusief instructies, tools, geschiedenis en multimodale inhoud waar van toepassing.

Reserveer bij een model met een gecombineerde invoer-/uitvoerlimiet ruimte voor de uitvoer voordat je de prompt toelaat. Lange contexten verhogen ook het geheugenverbruik van conventionele KV caches. Een ondersteunde sequentielimiet bewijst niet dat je GPU genoeg geheugen heeft bij het vereiste aantal gelijktijdige verzoeken.

Wat positiemethoden veranderen

Attention heeft positie-informatie nodig om de volgorde en afstand van tokens te onderscheiden. RoPE roteert query- en keyvectoren met positieafhankelijke hoeken, waardoor hun inwendige producten afhangen van zowel relatieve posities als inhoud. Een causaal masker beperkt de zichtbaarheid van toekomstige tokens; dat is niet hetzelfde als expliciete relatieve positie-encodering.

ALiBi voegt in plaats daarvan afstandsafhankelijke biases toe aan attention-scores. YaRN verandert de frequentieschaling van RoPE en past een model aan voor langere contexten. Deze methoden zijn onder bepaalde omstandigheden getest. Alleen een contextinstelling of schaalfactor veranderen toont geen betrouwbare extrapolatie voor een willekeurig checkpoint aan.

Test retrieval van bewijs en de nauwkeurigheid van de taak bij verschillende lengtes, met feiten aan het begin, in het midden en aan het einde. Meet TTFT, de latency van latere tokens, het piekgeheugenverbruik en het gedrag bij afkappen. Als het model het verzoek accepteert maar noodzakelijk bewijs mist, valt het verzoek binnen een groottelimiet, maar is de toepassingstaak mislukt.

De Engineeringgids: context windows en positie-encoderingen legt de methoden en hun oorspronkelijke experimenten uit.