Como reduzir os custos dos LLM sem perder qualidade nas respostas?
Tradução automática
Este artigo foi traduzido automaticamente a partir da versão original em inglês.
Meça o custo por tarefa concluída com sucesso e depois teste limites de saída, cache, processamento por lotes ou modelos mais baratos num conjunto de avaliação reservado. Uma fatura de tokens mais baixa só é útil se o sistema continuar a cumprir os requisitos de qualidade e latência. Comece pelo trabalho repetido ou pelos grupos de pedidos dispendiosos visíveis nos dados de utilização.
Determine o custo real
Para uma API com preços por milhão de tokens, o custo simplificado de um pedido sem cache é:
Utilize tarifas atuais, como as da documentação de preços da OpenAI. Contabilize separadamente os preços das entradas em cache, os encargos das ferramentas e as novas tentativas. Compare a soma de todas as chamadas necessárias para concluir uma tarefa, incluindo o encaminhamento e a validação.
No alojamento em infraestrutura própria, inclua o tempo de GPU, a capacidade inativa, o armazenamento, a rede, as operações e o trabalho de engenharia. Dividir apenas o custo de aluguer de GPU pelos tokens gerados pode ocultar custos consideráveis.
Aplique a alteração ao tráfego adequado
| Alteração | Onde pode ajudar | O que verificar |
|---|---|---|
| Saídas mais curtas | Respostas com pormenores desnecessários | Completude e erros de truncagem |
| Cache de prefixos | Prefixos de prompts compatíveis e repetidos | Taxa de acertos, condições do fornecedor e memória retida |
| Processamento por lotes | Trabalho que pode esperar | Prazo de conclusão e tratamento de falhas |
| Encaminhamento de modelos | Pedidos a que um modelo mais barato pode responder | Pedidos mal encaminhados, custo do encaminhador e qualidade de ponta a ponta |
| Quantização | Pares de modelo/runtime suportados em infraestrutura própria | Qualidade, débito, memória e tamanho de lote utilizável |
Não remova elementos de suporte recuperados apenas para encurtar um prompt. Verifique se a falta de contexto aumenta as respostas erradas ou as novas tentativas.
Compare tarefas completas
Suponha que uma carga de trabalho hipotética envia 70% dos pedidos para um modelo mais barato e 30% para um modelo mais capaz. O custo das chamadas aos modelos é 0.7 × cheap cost + 0.3 × strong cost, acrescido do encaminhamento, das novas tentativas e de outras chamadas. São pressupostos sobre o tráfego, não uma previsão de poupança.
Execute o mesmo conjunto de avaliação antes e depois da alteração. Apresente os erros de qualidade, a latência, a taxa de conclusão e o custo total. RouteLLM ilustra o encaminhamento sujeito a restrições de qualidade em experiências específicas; a sua proporção histórica de custos não prevê a sua fatura.
Leia a secção sobre otimização de custos no LLM Engineering Guide para conhecer as técnicas de serving relacionadas.