Quando é que a descodificação especulativa acelera o serving de LLM?

Tradução automática

Este artigo foi traduzido automaticamente a partir da versão original em inglês.

A descodificação especulativa pode acelerar a geração quando propor vários tokens candidatos tem um custo baixo e o modelo-alvo aceita um número suficiente deles. O modelo-alvo verifica os candidatos em conjunto, podendo devolver vários tokens de saída por ronda. O trabalho adicional de proposta pode, pelo contrário, tornar o serving mais lento quando a aceitação é baixa ou o modelo-alvo já funciona de forma eficiente com lotes grandes.

Meça o ciclo completo de geração, incluindo propostas e rejeições, antes de escolher esta técnica para um serviço.

Compreender uma ronda de verificação

Um modelo de proposta sugere K tokens. O modelo-alvo avalia as posições candidatas numa passagem de propagação direta por lotes. A amostragem por rejeição modificada aceita os candidatos da esquerda para a direita usando ambas as distribuições. Após a primeira rejeição, extrai uma correção da distribuição residual do modelo-alvo e descarta os candidatos seguintes. Se todos os candidatos forem aceites, também pode extrair um token adicional do modelo-alvo.

O algoritmo de amostragem especulativa de Chen et al. preserva a distribuição-alvo sob os pressupostos do algoritmo, sujeito aos efeitos numéricos do hardware. Comparar simplesmente os tokens candidatos com os tokens selecionados pelo modelo-alvo não é o mesmo algoritmo de amostragem. Verifique o comportamento de amostragem e as definições suportadas pela implementação escolhida.

O artigo reportou uma aceleração da descodificação de 2–2.5x para o modelo-alvo Chinchilla-70B testado, com um modelo de proposta de 4B, um lote de tamanho um e K=4 em TPU v4. Este resultado histórico mostra que o mecanismo pode ajudar, mas não prevê o desempenho de outro par de modelos.

Verificar o que determina o ganho

MedidaInterpretação
Tokens aceites por ronda de verificaçãoQue quantidade de saída amortiza a execução do modelo-alvo
Tempo de propostaCusto de propor candidatos
Tempo de verificação e correçãoTrabalho do modelo-alvo e custo adicional dos candidatos rejeitados
Débito e latência em função da concorrênciaSe o ganho se mantém com lotes realistas
Qualidade das tarefas e definições de amostragemSe o método escolhido preserva o comportamento pretendido

Os métodos com modelos de proposta são uma opção. EAGLE-3 combina vários níveis de características do modelo-alvo e prevê diretamente os tokens propostos; outras abordagens usam cabeças de previsão adicionais ou correspondências com o prompt. As suas taxas de aceitação e custos de execução diferem.

Teste código, prosa, structured outputs e comprimentos de contexto representativos. Comece com poucos tokens propostos e depois varie esse número em conjunto com a concorrência. Mais candidatos não ajudam se o custo de os propor e verificar exceder o trabalho evitado.

Guia de engenharia: descodificação especulativa explica a sequência de aceitação e as variantes do método.