Routage ou cascade de LLM : quel modèle traite une requête ?
Traduction automatique
Cet article a été traduit automatiquement depuis la version originale en anglais.
Le routage choisit un modèle avant qu’il génère une réponse. Une cascade commence avec un modèle, puis passe à un modèle plus performant après avoir évalué sa réponse. Utilisez le routage lorsque la requête fournit assez d’informations pour choisir de manière fiable. Envisagez une cascade lorsque la vérification d’une réponse terminée fournit une meilleure base de décision.
Les deux approches peuvent réduire les appels aux modèles coûteux. Leurs erreurs et leurs coûts en latence diffèrent.
Quand la décision est-elle prise ?
| Approche | Informations utilisées pour décider | Échec principal | Coût à inclure |
|---|---|---|---|
| Routage | Caractéristiques de la requête et capacités prédites du modèle | Une requête difficile est confiée à un modèle insuffisant | Routeur et modèle sélectionné |
| Cascade | Une réponse générée et son évaluation | Une réponse erronée passe la vérification | Modèle initial, évaluateur et appels après escalade |
Un routeur pourrait envoyer une question de FAQ courante à un petit modèle et une analyse complexe à un modèle plus performant. Une cascade pourrait accepter une extraction peu coûteuse uniquement après avoir validé ses champs par rapport à la source, puis passer à un modèle plus performant en cas d’échec.
La confiance déclarée par le modèle qui répond ne suffit pas à valider la réponse. Préférez une vérification liée à la bonne exécution de la tâche, comme des champs vérifiés dans la source ou des tests avec une couverture suffisante.
Le tableau 6 de l’article RouteLLM rapporte un coût estimé divisé par 3.66 dans sa configuration MT-Bench, à 95% de son score de qualité GPT-4. Cela représente un coût inférieur d’environ 72.7% avec les prix historiques des modèles et la configuration d’évaluation utilisés. Ce résultat concerne cette expérience ; ce n’est pas une prévision des économies actuelles.
FrugalGPT étudie les cascades au sein d’un ensemble de modèles. Les économies maximales rapportées dépendent également des tâches, des modèles choisis et du score utilisé pour accepter les réponses.
Mesurez séparément les erreurs acceptées
Évaluez des cas faciles et difficiles, y compris des requêtes pour lesquelles le modèle peu coûteux produit une réponse erronée mais plausible. Consignez la proportion traitée à faible coût, les réponses erronées du modèle peu coûteux qui sont acceptées, les escalades, la qualité globale et la latence de bout en bout.
Pour les cascades, incluez les deux appels dans les requêtes avec escalade. Pour le routage, incluez la latence du routeur et les requêtes mal orientées. Comparez ces totaux à des références utilisant un seul modèle, avec le niveau de qualité dont vous avez réellement besoin.
La section sur le routage et les cascades du LLM Engineering Guide illustre les deux moments de décision.