O que as janelas de contexto dos LLM limitam e como RoPE as amplia

Tradução automática

Este artigo foi traduzido automaticamente a partir da versão original em inglês.

A janela de contexto de um LLM limita a sequência de tokens disponível para um pedido de geração. Uma API pode especificar limites separados de entrada e saída, ou um limite combinado. Não é simplesmente o número de tokens processados numa única passagem direta: o prefill por blocos e a descodificação com cache podem processar a sequência de forma incremental.

Os engenheiros que trabalham com documentos longos precisam de verificar tanto os limites de sequência do modelo como a fiabilidade com que utiliza a informação necessária.

Leia os nomes dos campos publicados

Segundo a documentação destes modelos específicos:

ModeloLimite publicadoMáximo de saída separado
GPT-4.1Janela de contexto de 1,047,576 tokens32,768 tokens
Gemini 2.5 Pro1,048,576 tokens de entrada65,536 tokens

As especificações de GPT-4.1 e Gemini 2.5 Pro usam designações diferentes. Não interprete estes números como regras idênticas para um orçamento combinado. Aplique os limites atuais da API selecionada ao pedido serializado, incluindo instruções, ferramentas, histórico e conteúdo multimodal, quando aplicável.

Num modelo com um limite combinado de entrada e saída, reserve espaço para a saída antes de admitir o prompt. Os contextos longos também aumentam a memória necessária para a KV cache convencional. Um limite de sequência suportado não prova que a sua GPU tenha memória suficiente para o número necessário de pedidos simultâneos.

O que os métodos posicionais alteram

A atenção precisa de informação de posição para distinguir a ordem e a distância entre tokens. RoPE roda os vetores de consulta e de chave por ângulos dependentes da posição, fazendo com que os seus produtos escalares dependam das posições relativas e do conteúdo. Uma máscara causal restringe a visibilidade dos tokens futuros; não é o mesmo que uma codificação explícita da posição relativa.

ALiBi, por sua vez, acrescenta termos de viés dependentes da distância às pontuações de atenção. YaRN altera o escalonamento das frequências de RoPE e adapta um modelo a contextos mais longos. Estes métodos foram testados em condições específicas. Alterar apenas uma definição de contexto ou um fator de escala não demonstra uma extrapolação fiável para qualquer checkpoint.

Teste a recuperação de evidências e a precisão da tarefa com diferentes comprimentos, incluindo factos perto do início, do meio e do fim. Meça TTFT, a latência dos tokens posteriores, o pico de memória e o comportamento do truncamento. Se o modelo aceitar o pedido mas não encontrar evidências necessárias, o pedido está dentro de um limite de tamanho, mas a tarefa da aplicação falhou.

O Guia de engenharia: janelas de contexto e codificações posicionais explica os métodos e as suas experiências originais.