Escalabilidade de Chinchilla: treinar mais reduz o custo dos LLM?

Tradução automática

Este artigo foi traduzido automaticamente a partir da versão original em inglês.

A escalabilidade de Chinchilla estima como dividir um orçamento fixo de computação de treino entre o tamanho do modelo e os tokens de treino. Não minimiza o custo total do modelo ao longo de toda a sua vida útil em serving. Um modelo mais pequeno treinado durante mais tempo pode custar mais a treinar e menos a utilizar, se cumprir o mesmo requisito de qualidade.

O volume previsto de inferência altera quais os investimentos em treino que podem compensar o seu custo.

O que significa a proporção de 20 tokens

O artigo de Chinchilla treinou um modelo com 70B parâmetros em 1.4 biliões de tokens. Isso corresponde a 20 tokens de treino por parâmetro. A sua análise de escalabilidade concluiu que o tamanho do modelo e os dados de treino devem aumentar em conjunto para utilizar eficientemente a computação de treino, sob os pressupostos estudados.

Trate 20:1 como um ponto aproximado dessa análise, não como um requisito para qualquer arquitetura, dataset ou implementação. A qualidade dos dados, os exemplos repetidos, os métodos de treino e a tarefa pretendida alteram o que os tokens adicionais permitem alcançar.

O relatório de Llama 3 descreve o treino dos seus modelos mais pequenos com muito mais tokens por parâmetro. Isto segue um objetivo económico diferente: melhorar um modelo mais pequeno cuja inferência poderá ser executada muitas vezes após o treino. Uma proporção maior não multiplica a qualidade nem significa que cada token adicional compense o seu custo.

Compare o custo total com a qualidade exigida

Uma estimativa útil inclui o treino, a inferência prevista e os custos operacionais. Suponha que dois candidatos cumprem o mesmo limiar para a tarefa:

CandidatoCusto único de treinoCusto de serving por pedido
Modelo maior, treino mais curtoInferior neste exemploSuperior
Modelo mais pequeno, treino mais longoSuperior neste exemploInferior

O candidato mais pequeno recupera a despesa adicional de treino apenas após um número suficiente de pedidos. Divida o custo adicional de treino pela poupança por pedido para estimar esse número. Inclua a avaliação, as atualizações do modelo e o trabalho de infraestrutura antes de utilizar a estimativa numa decisão de compra.

Meça a qualidade e o custo de serving com a mesma distribuição de entradas e comprimentos de saída. Se o modelo mais pequeno precisar de novas tentativas, de recorrer a um modelo mais capaz ou de saídas mais longas, inclua também esses custos.

A secção sobre leis de escalabilidade do LLM Engineering Guide compara proporções publicadas de tokens de treino por parâmetro e distingue os dois objetivos.