Encaminhamento ou cascatas de LLM: que modelo trata uma consulta?

Tradução automática

Este artigo foi traduzido automaticamente a partir da versão original em inglês.

O encaminhamento escolhe um modelo antes de este gerar uma resposta. Uma cascata começa com um modelo e passa para um mais capaz após avaliar a sua resposta. Use o encaminhamento quando a consulta fornecer informação suficiente para escolher de forma fiável. Considere cascatas quando verificar uma resposta concluída oferecer uma melhor base para decidir.

Ambos podem reduzir as chamadas a modelos caros. Os seus erros e custos de latência diferem.

Quando é tomada a decisão?

AbordagemInformação para decidirFalha principalCusto a incluir
EncaminhamentoCaracterísticas da consulta e capacidade prevista do modeloUma consulta difícil é enviada para um modelo insuficienteEncaminhador e modelo selecionado
CascataUma resposta gerada e a sua avaliaçãoUma resposta errada passa na verificaçãoModelo inicial, avaliador e chamadas após a escalada

Um encaminhador pode enviar uma pergunta habitual de FAQ para um modelo pequeno e uma análise complexa para um mais capaz. Uma cascata pode aceitar uma extração barata apenas depois de validar os seus campos face à fonte e passar para um modelo mais capaz se a validação falhar.

A confiança declarada pelo modelo que responde não é validação suficiente. Prefira uma verificação ligada à execução correta da tarefa, como campos verificados na fonte ou testes com cobertura adequada.

A tabela 6 do artigo RouteLLM apresenta um custo estimado dividido por 3.66 na configuração de MT-Bench utilizada, com 95% da sua pontuação de qualidade do GPT-4. Isso corresponde a um custo cerca de 72.7% inferior com os preços históricos dos modelos e a configuração de avaliação utilizados. É evidência dessa experiência, não uma previsão de poupanças atuais.

O FrugalGPT estuda cascatas num conjunto de modelos. As maiores poupanças reportadas também dependem das tarefas, dos modelos escolhidos e da pontuação usada para aceitar respostas.

Meça separadamente os erros aceites

Avalie casos fáceis e difíceis, incluindo consultas em que o modelo barato produz uma resposta plausível mas errada. Registe a proporção tratada a baixo custo, as respostas incorretas do modelo barato que são aceites, as escaladas, a qualidade global e a latência de ponta a ponta.

Nas cascatas, inclua ambas as chamadas nos pedidos com escalada. No encaminhamento, inclua a latência do encaminhador e os pedidos enviados para o modelo errado. Compare estes totais com referências que usem um único modelo ao nível de qualidade de que realmente precisa.

A secção sobre encaminhamento e cascatas do LLM Engineering Guide ilustra ambos os momentos de decisão.