Destilação de LLM: como aprendem os modelos pequenos com os professores?
Tradução automática
Este artigo foi traduzido automaticamente a partir da versão original em inglês.
A destilação de LLM treina um modelo aluno com sinais produzidos por um modelo professor. Os métodos baseados em logits aproximam as distribuições de saída. Os métodos baseados em dados treinam com exemplos gerados pelo professor. Considere a destilação quando um modelo mais pequeno puder atingir um limiar definido para uma tarefa com um custo de serving inferior.
A destilação não garante que o aluno conserve todas as capacidades do professor. A cobertura dos dados e a tarefa de avaliação determinam o que é transferido.
Duas formas de transferir comportamento
| Método | Informação do professor | Requisito principal |
|---|---|---|
| Destilação baseada em logits | Probabilidades de tokens ou logits | Acesso às distribuições e um objetivo de treino compatível |
| Destilação baseada em dados | Exemplos gerados de entrada e saída | Exemplos revistos ou filtrados e fine-tuning do aluno |
Um professor acessível apenas por API pode permitir a destilação baseada em dados, mesmo que não disponibilize as distribuições necessárias ao seu método de treino com logits. Diferenças entre tokenizadores ou arquiteturas podem tornar mais complexa a correspondência direta entre distribuições.
O relatório DeepSeek-R1 descreve o fine-tuning de modelos Qwen e Llama mais pequenos com uma mistura selecionada de cerca de 800,000 exemplos. Os modelos destilados obtiveram bons resultados nos benchmarks de raciocínio do artigo. Esses resultados demonstram que a transferência funcionou nessa configuração; não mostram que um aluno pequeno possa substituir qualquer professor em qualquer carga de trabalho.
Crie exemplos para uma tarefa mensurável
Para um classificador de pedidos de apoio, forneça tipos de perguntas reais e peça ao professor que proponha rótulos e explicações. Verifique os rótulos segundo uma taxonomia revista; rejeite classificações sem fundamento. Inclua classes raras e casos ambíguos em vez de produzir muitas paráfrases simples de pedidos comuns.
Separe os exemplos de treino gerados pelo professor do conjunto de avaliação reservado. Caso contrário, o aluno pode parecer eficaz porque o teste reutiliza exemplos do treino em vez de medir casos que ainda não viu. Antes de gerar o dataset, verifique se as condições do professor permitem o uso previsto para treino.
Compare o aluno tanto com o professor como com o seu próprio modelo de base sem adaptação. Meça a qualidade na tarefa, os tipos de erro, o comprimento das saídas, a latência e o custo com a concorrência prevista. Inclua as chamadas de recurso ao professor ao estimar as poupanças.
Utilize as explicações do professor apenas quando melhorarem o comportamento medido do aluno; as saídas-alvo mais longas também custam mais a gerar e a aprender durante o treino.
A secção sobre destilação do LLM Engineering Guide descreve as comparações publicadas do R1 e as suas limitações.