O que as janelas de contexto dos LLM limitam e como RoPE as amplia
Tradução automática
Este artigo foi traduzido automaticamente a partir da versão original em inglês.
A janela de contexto de um LLM limita a sequência de tokens disponível para um pedido de geração. Uma API pode especificar limites separados de entrada e saída, ou um limite combinado. Não é simplesmente o número de tokens processados numa única passagem direta: o prefill por blocos e a descodificação com cache podem processar a sequência de forma incremental.
Os engenheiros que trabalham com documentos longos precisam de verificar tanto os limites de sequência do modelo como a fiabilidade com que utiliza a informação necessária.
Leia os nomes dos campos publicados
Segundo a documentação destes modelos específicos:
| Modelo | Limite publicado | Máximo de saída separado |
|---|---|---|
| GPT-4.1 | Janela de contexto de 1,047,576 tokens | 32,768 tokens |
| Gemini 2.5 Pro | 1,048,576 tokens de entrada | 65,536 tokens |
As especificações de GPT-4.1 e Gemini 2.5 Pro usam designações diferentes. Não interprete estes números como regras idênticas para um orçamento combinado. Aplique os limites atuais da API selecionada ao pedido serializado, incluindo instruções, ferramentas, histórico e conteúdo multimodal, quando aplicável.
Num modelo com um limite combinado de entrada e saída, reserve espaço para a saída antes de admitir o prompt. Os contextos longos também aumentam a memória necessária para a KV cache convencional. Um limite de sequência suportado não prova que a sua GPU tenha memória suficiente para o número necessário de pedidos simultâneos.
O que os métodos posicionais alteram
A atenção precisa de informação de posição para distinguir a ordem e a distância entre tokens. RoPE roda os vetores de consulta e de chave por ângulos dependentes da posição, fazendo com que os seus produtos escalares dependam das posições relativas e do conteúdo. Uma máscara causal restringe a visibilidade dos tokens futuros; não é o mesmo que uma codificação explícita da posição relativa.
ALiBi, por sua vez, acrescenta termos de viés dependentes da distância às pontuações de atenção. YaRN altera o escalonamento das frequências de RoPE e adapta um modelo a contextos mais longos. Estes métodos foram testados em condições específicas. Alterar apenas uma definição de contexto ou um fator de escala não demonstra uma extrapolação fiável para qualquer checkpoint.
Teste a recuperação de evidências e a precisão da tarefa com diferentes comprimentos, incluindo factos perto do início, do meio e do fim. Meça TTFT, a latência dos tokens posteriores, o pico de memória e o comportamento do truncamento. Se o modelo aceitar o pedido mas não encontrar evidências necessárias, o pedido está dentro de um limite de tamanho, mas a tarefa da aplicação falhou.
O Guia de engenharia: janelas de contexto e codificações posicionais explica os métodos e as suas experiências originais.