Ce que limitent les fenêtres de contexte des LLM et comment RoPE les étend

Traduction automatique

Cet article a été traduit automatiquement depuis la version originale en anglais.

La fenêtre de contexte d’un LLM limite la séquence de tokens disponible pour une requête de génération. Une API peut définir des limites distinctes pour l’entrée et la sortie, ou une limite combinée. Il ne s’agit pas simplement du nombre de tokens traités en une seule passe avant : le prefill par blocs et le décodage avec cache peuvent traiter la séquence progressivement.

Les ingénieurs qui traitent de longs documents doivent vérifier les limites de séquence du modèle et sa capacité à utiliser les informations nécessaires de manière fiable.

Lisez les noms des champs publiés

D’après la documentation de ces modèles précis :

ModèleLimite publiéeMaximum de sortie distinct
GPT-4.1Fenêtre de contexte de 1,047,576 tokens32,768 tokens
Gemini 2.5 Pro1,048,576 tokens en entrée65,536 tokens

Les spécifications de GPT-4.1 et de Gemini 2.5 Pro utilisent des libellés différents. N’interprétez pas ces chiffres comme des règles identiques pour un budget combiné. Appliquez les limites actuelles de l’API choisie à la requête sérialisée, y compris les instructions, les outils, l’historique et le contenu multimodal, le cas échéant.

Pour un modèle avec une limite combinée d’entrée et de sortie, réservez de l’espace pour la sortie avant d’accepter le prompt. Les contextes longs augmentent aussi la mémoire nécessaire au KV cache classique. Une limite de séquence prise en charge ne prouve pas que votre GPU dispose d’assez de mémoire pour le nombre de requêtes simultanées requis.

Ce que changent les méthodes de position

L’attention a besoin d’informations de position pour distinguer l’ordre des tokens et leur distance. RoPE fait tourner les vecteurs de requête et de clé selon des angles dépendant de la position. Leurs produits scalaires dépendent ainsi des positions relatives et du contenu. Un masque causal restreint la visibilité des tokens futurs ; ce n’est pas la même chose qu’un encodage explicite des positions relatives.

ALiBi ajoute plutôt des biais dépendant de la distance aux scores d’attention. YaRN modifie la mise à l’échelle des fréquences de RoPE et adapte un modèle à des contextes plus longs. Ces méthodes ont été testées dans des conditions précises. Modifier uniquement un réglage du contexte ou un facteur d’échelle ne démontre pas une extrapolation fiable pour n’importe quel checkpoint.

Testez la récupération des éléments probants et la précision de la tâche à différentes longueurs, avec des faits proches du début, du milieu et de la fin. Mesurez TTFT, la latence des tokens suivants, le pic de mémoire et le comportement de troncature. Si le modèle accepte la requête mais manque des éléments nécessaires, la requête respecte une limite de taille, mais la tâche de l’application a échoué.

Le Guide d’ingénierie : fenêtres de contexte et encodages positionnels explique les méthodes et leurs expériences d’origine.