Encaminhamento ou cascatas de LLM: que modelo trata uma consulta?
Tradução automática
Este artigo foi traduzido automaticamente a partir da versão original em inglês.
O encaminhamento escolhe um modelo antes de este gerar uma resposta. Uma cascata começa com um modelo e passa para um mais capaz após avaliar a sua resposta. Use o encaminhamento quando a consulta fornecer informação suficiente para escolher de forma fiável. Considere cascatas quando verificar uma resposta concluída oferecer uma melhor base para decidir.
Ambos podem reduzir as chamadas a modelos caros. Os seus erros e custos de latência diferem.
Quando é tomada a decisão?
| Abordagem | Informação para decidir | Falha principal | Custo a incluir |
|---|---|---|---|
| Encaminhamento | Características da consulta e capacidade prevista do modelo | Uma consulta difícil é enviada para um modelo insuficiente | Encaminhador e modelo selecionado |
| Cascata | Uma resposta gerada e a sua avaliação | Uma resposta errada passa na verificação | Modelo inicial, avaliador e chamadas após a escalada |
Um encaminhador pode enviar uma pergunta habitual de FAQ para um modelo pequeno e uma análise complexa para um mais capaz. Uma cascata pode aceitar uma extração barata apenas depois de validar os seus campos face à fonte e passar para um modelo mais capaz se a validação falhar.
A confiança declarada pelo modelo que responde não é validação suficiente. Prefira uma verificação ligada à execução correta da tarefa, como campos verificados na fonte ou testes com cobertura adequada.
A tabela 6 do artigo RouteLLM apresenta um custo estimado dividido por 3.66 na configuração de MT-Bench utilizada, com 95% da sua pontuação de qualidade do GPT-4. Isso corresponde a um custo cerca de 72.7% inferior com os preços históricos dos modelos e a configuração de avaliação utilizados. É evidência dessa experiência, não uma previsão de poupanças atuais.
O FrugalGPT estuda cascatas num conjunto de modelos. As maiores poupanças reportadas também dependem das tarefas, dos modelos escolhidos e da pontuação usada para aceitar respostas.
Meça separadamente os erros aceites
Avalie casos fáceis e difíceis, incluindo consultas em que o modelo barato produz uma resposta plausível mas errada. Registe a proporção tratada a baixo custo, as respostas incorretas do modelo barato que são aceites, as escaladas, a qualidade global e a latência de ponta a ponta.
Nas cascatas, inclua ambas as chamadas nos pedidos com escalada. No encaminhamento, inclua a latência do encaminhador e os pedidos enviados para o modelo errado. Compare estes totais com referências que usem um único modelo ao nível de qualidade de que realmente precisa.
A secção sobre encaminhamento e cascatas do LLM Engineering Guide ilustra ambos os momentos de decisão.