Qué limitan las ventanas de contexto de los LLM y cómo las amplía RoPE

Traducción automática

Este artículo se tradujo automáticamente a partir de la versión original en inglés.

La ventana de contexto de un LLM limita la secuencia de tokens disponible para una solicitud de generación. Una API puede especificar límites independientes de entrada y salida, o un límite combinado. No es simplemente el número de tokens procesados en una sola pasada hacia delante: el prefill por bloques y la decodificación con caché pueden procesar la secuencia de forma incremental.

Los ingenieros que trabajan con documentos largos deben comprobar tanto los límites de secuencia del modelo como si utiliza la información necesaria de forma fiable.

Lee los nombres de los campos publicados

Según la documentación de estos modelos concretos:

ModeloLímite publicadoMáximo de salida independiente
GPT-4.1Ventana de contexto de 1,047,576 tokens32,768 tokens
Gemini 2.5 Pro1,048,576 tokens de entrada65,536 tokens

Las especificaciones de GPT-4.1 y Gemini 2.5 Pro utilizan etiquetas distintas. No interpretes esas cifras como reglas idénticas para un presupuesto combinado. Aplica los límites actuales de la API seleccionada a la solicitud serializada, incluidas las instrucciones, las herramientas, el historial y el contenido multimodal cuando corresponda.

En un modelo con un límite combinado de entrada y salida, reserva espacio para la salida antes de admitir el prompt. Los contextos largos también aumentan la memoria de la KV cache convencional. Que una longitud de secuencia esté admitida no demuestra que tu GPU tenga memoria suficiente para la concurrencia necesaria.

Qué cambian los métodos de posición

La atención necesita información de posición para distinguir el orden y la distancia entre tokens. RoPE rota los vectores de consulta y clave mediante ángulos que dependen de la posición, de modo que sus productos escalares dependen tanto de las posiciones relativas como del contenido. Una máscara causal restringe la visibilidad de los tokens futuros; no equivale a una codificación explícita de posiciones relativas.

ALiBi, en cambio, añade sesgos dependientes de la distancia a las puntuaciones de atención. YaRN modifica el escalado de frecuencias de RoPE y adapta un modelo a contextos más largos. Estos métodos se han probado en condiciones concretas. Cambiar únicamente un ajuste de contexto o un factor de escala no demuestra una extrapolación fiable para cualquier checkpoint.

Prueba la recuperación de evidencias y la precisión de la tarea con distintas longitudes, incluidos hechos cerca del principio, del medio y del final. Mide TTFT, la latencia de los tokens posteriores, el pico de memoria y el comportamiento del truncamiento. Si el modelo acepta la solicitud pero omite evidencias necesarias, la solicitud está dentro de un límite de tamaño, pero no ha resuelto la tarea de la aplicación.

La Guía de ingeniería: ventanas de contexto y codificaciones posicionales explica los métodos y sus experimentos originales.