Quando é que a descodificação especulativa acelera o serving de LLM?
Tradução automática
Este artigo foi traduzido automaticamente a partir da versão original em inglês.
A descodificação especulativa pode acelerar a geração quando propor vários tokens candidatos tem um custo baixo e o modelo-alvo aceita um número suficiente deles. O modelo-alvo verifica os candidatos em conjunto, podendo devolver vários tokens de saída por ronda. O trabalho adicional de proposta pode, pelo contrário, tornar o serving mais lento quando a aceitação é baixa ou o modelo-alvo já funciona de forma eficiente com lotes grandes.
Meça o ciclo completo de geração, incluindo propostas e rejeições, antes de escolher esta técnica para um serviço.
Compreender uma ronda de verificação
Um modelo de proposta sugere K tokens. O modelo-alvo avalia as posições candidatas numa passagem de propagação direta por lotes. A amostragem por rejeição modificada aceita os candidatos da esquerda para a direita usando ambas as distribuições. Após a primeira rejeição, extrai uma correção da distribuição residual do modelo-alvo e descarta os candidatos seguintes. Se todos os candidatos forem aceites, também pode extrair um token adicional do modelo-alvo.
O algoritmo de amostragem especulativa de Chen et al. preserva a distribuição-alvo sob os pressupostos do algoritmo, sujeito aos efeitos numéricos do hardware. Comparar simplesmente os tokens candidatos com os tokens selecionados pelo modelo-alvo não é o mesmo algoritmo de amostragem. Verifique o comportamento de amostragem e as definições suportadas pela implementação escolhida.
O artigo reportou uma aceleração da descodificação de 2–2.5x para o modelo-alvo Chinchilla-70B testado, com um modelo de proposta de 4B, um lote de tamanho um e K=4 em TPU v4. Este resultado histórico mostra que o mecanismo pode ajudar, mas não prevê o desempenho de outro par de modelos.
Verificar o que determina o ganho
| Medida | Interpretação |
|---|---|
| Tokens aceites por ronda de verificação | Que quantidade de saída amortiza a execução do modelo-alvo |
| Tempo de proposta | Custo de propor candidatos |
| Tempo de verificação e correção | Trabalho do modelo-alvo e custo adicional dos candidatos rejeitados |
| Débito e latência em função da concorrência | Se o ganho se mantém com lotes realistas |
| Qualidade das tarefas e definições de amostragem | Se o método escolhido preserva o comportamento pretendido |
Os métodos com modelos de proposta são uma opção. EAGLE-3 combina vários níveis de características do modelo-alvo e prevê diretamente os tokens propostos; outras abordagens usam cabeças de previsão adicionais ou correspondências com o prompt. As suas taxas de aceitação e custos de execução diferem.
Teste código, prosa, structured outputs e comprimentos de contexto representativos. Comece com poucos tokens propostos e depois varie esse número em conjunto com a concorrência. Mais candidatos não ajudam se o custo de os propor e verificar exceder o trabalho evitado.
Guia de engenharia: descodificação especulativa explica a sequência de aceitação e as variantes do método.