Como reduzir os custos dos LLM sem perder qualidade nas respostas?

Tradução automática

Este artigo foi traduzido automaticamente a partir da versão original em inglês.

Meça o custo por tarefa concluída com sucesso e depois teste limites de saída, cache, processamento por lotes ou modelos mais baratos num conjunto de avaliação reservado. Uma fatura de tokens mais baixa só é útil se o sistema continuar a cumprir os requisitos de qualidade e latência. Comece pelo trabalho repetido ou pelos grupos de pedidos dispendiosos visíveis nos dados de utilização.

Determine o custo real

Para uma API com preços por milhão de tokens, o custo simplificado de um pedido sem cache é:

cost=input tokens×input price+output tokens×output price106\text{cost} = \frac{\text{input tokens} \times \text{input price} + \text{output tokens} \times \text{output price}}{10^6}

Utilize tarifas atuais, como as da documentação de preços da OpenAI. Contabilize separadamente os preços das entradas em cache, os encargos das ferramentas e as novas tentativas. Compare a soma de todas as chamadas necessárias para concluir uma tarefa, incluindo o encaminhamento e a validação.

No alojamento em infraestrutura própria, inclua o tempo de GPU, a capacidade inativa, o armazenamento, a rede, as operações e o trabalho de engenharia. Dividir apenas o custo de aluguer de GPU pelos tokens gerados pode ocultar custos consideráveis.

Aplique a alteração ao tráfego adequado

AlteraçãoOnde pode ajudarO que verificar
Saídas mais curtasRespostas com pormenores desnecessáriosCompletude e erros de truncagem
Cache de prefixosPrefixos de prompts compatíveis e repetidosTaxa de acertos, condições do fornecedor e memória retida
Processamento por lotesTrabalho que pode esperarPrazo de conclusão e tratamento de falhas
Encaminhamento de modelosPedidos a que um modelo mais barato pode responderPedidos mal encaminhados, custo do encaminhador e qualidade de ponta a ponta
QuantizaçãoPares de modelo/runtime suportados em infraestrutura própriaQualidade, débito, memória e tamanho de lote utilizável

Não remova elementos de suporte recuperados apenas para encurtar um prompt. Verifique se a falta de contexto aumenta as respostas erradas ou as novas tentativas.

Compare tarefas completas

Suponha que uma carga de trabalho hipotética envia 70% dos pedidos para um modelo mais barato e 30% para um modelo mais capaz. O custo das chamadas aos modelos é 0.7 × cheap cost + 0.3 × strong cost, acrescido do encaminhamento, das novas tentativas e de outras chamadas. São pressupostos sobre o tráfego, não uma previsão de poupança.

Execute o mesmo conjunto de avaliação antes e depois da alteração. Apresente os erros de qualidade, a latência, a taxa de conclusão e o custo total. RouteLLM ilustra o encaminhamento sujeito a restrições de qualidade em experiências específicas; a sua proporção histórica de custos não prevê a sua fatura.

Leia a secção sobre otimização de custos no LLM Engineering Guide para conhecer as técnicas de serving relacionadas.