Escalabilidade de Chinchilla: treinar mais reduz o custo dos LLM?
Tradução automática
Este artigo foi traduzido automaticamente a partir da versão original em inglês.
A escalabilidade de Chinchilla estima como dividir um orçamento fixo de computação de treino entre o tamanho do modelo e os tokens de treino. Não minimiza o custo total do modelo ao longo de toda a sua vida útil em serving. Um modelo mais pequeno treinado durante mais tempo pode custar mais a treinar e menos a utilizar, se cumprir o mesmo requisito de qualidade.
O volume previsto de inferência altera quais os investimentos em treino que podem compensar o seu custo.
O que significa a proporção de 20 tokens
O artigo de Chinchilla treinou um modelo com 70B parâmetros em 1.4 biliões de tokens. Isso corresponde a 20 tokens de treino por parâmetro. A sua análise de escalabilidade concluiu que o tamanho do modelo e os dados de treino devem aumentar em conjunto para utilizar eficientemente a computação de treino, sob os pressupostos estudados.
Trate 20:1 como um ponto aproximado dessa análise, não como um requisito para qualquer arquitetura, dataset ou implementação. A qualidade dos dados, os exemplos repetidos, os métodos de treino e a tarefa pretendida alteram o que os tokens adicionais permitem alcançar.
O relatório de Llama 3 descreve o treino dos seus modelos mais pequenos com muito mais tokens por parâmetro. Isto segue um objetivo económico diferente: melhorar um modelo mais pequeno cuja inferência poderá ser executada muitas vezes após o treino. Uma proporção maior não multiplica a qualidade nem significa que cada token adicional compense o seu custo.
Compare o custo total com a qualidade exigida
Uma estimativa útil inclui o treino, a inferência prevista e os custos operacionais. Suponha que dois candidatos cumprem o mesmo limiar para a tarefa:
| Candidato | Custo único de treino | Custo de serving por pedido |
|---|---|---|
| Modelo maior, treino mais curto | Inferior neste exemplo | Superior |
| Modelo mais pequeno, treino mais longo | Superior neste exemplo | Inferior |
O candidato mais pequeno recupera a despesa adicional de treino apenas após um número suficiente de pedidos. Divida o custo adicional de treino pela poupança por pedido para estimar esse número. Inclua a avaliação, as atualizações do modelo e o trabalho de infraestrutura antes de utilizar a estimativa numa decisão de compra.
Meça a qualidade e o custo de serving com a mesma distribuição de entradas e comprimentos de saída. Se o modelo mais pequeno precisar de novas tentativas, de recorrer a um modelo mais capaz ou de saídas mais longas, inclua também esses custos.
A secção sobre leis de escalabilidade do LLM Engineering Guide compara proporções publicadas de tokens de treino por parâmetro e distingue os dois objetivos.