Comment réduire les coûts des LLM sans dégrader la qualité des réponses ?
Traduction automatique
Cet article a été traduit automatiquement depuis la version originale en anglais.
Mesurez le coût par tâche réussie, puis testez les limites de sortie, la mise en cache, le traitement par lots ou des modèles moins chers sur un jeu d’évaluation réservé. Une facture de tokens plus faible n’est utile que si le système respecte toujours ses exigences de qualité et de latence. Commencez par le travail répété ou les groupes de requêtes coûteux visibles dans vos données d’utilisation.
Établir le coût réel
Pour une API dont les tarifs sont exprimés par million de tokens, le coût simplifié d’une requête sans cache est :
Utilisez les tarifs actuels, par exemple ceux de la documentation tarifaire d’OpenAI. Comptabilisez séparément les tarifs des entrées en cache, les frais des outils et les nouvelles tentatives. Comparez la somme de tous les appels nécessaires pour terminer une tâche, y compris le routage et la validation.
Pour un hébergement sur votre propre infrastructure, incluez le temps GPU, la capacité inutilisée, le stockage, le réseau, l’exploitation et l’ingénierie. Diviser uniquement le coût de location des GPU par les tokens générés peut masquer des coûts importants.
Appliquer le changement au trafic adapté
| Changement | Où il peut être utile | Points à vérifier |
|---|---|---|
| Sorties plus courtes | Réponses contenant des détails inutiles | Exhaustivité et erreurs de troncature |
| Mise en cache des préfixes | Préfixes de prompts compatibles et répétés | Taux de succès du cache, conditions du fournisseur et mémoire conservée |
| Traitement par lots | Travail pouvant attendre | Délai d’achèvement et gestion des échecs |
| Routage des modèles | Requêtes auxquelles un modèle moins cher peut répondre | Requêtes mal orientées, coût du routeur et qualité de bout en bout |
| Quantification | Couples modèle/runtime compatibles hébergés sur votre infrastructure | Qualité, débit, mémoire et taille de lot utilisable |
Ne retirez pas les éléments probants récupérés uniquement pour raccourcir un prompt. Vérifiez si le contexte manquant augmente les réponses incorrectes ou les nouvelles tentatives.
Comparer des tâches complètes
Supposons qu’une charge de travail hypothétique envoie 70% des requêtes à un modèle moins cher et 30% à un modèle plus performant. Le coût de ses appels aux modèles est 0.7 × cheap cost + 0.3 × strong cost, auquel s’ajoutent le routage, les nouvelles tentatives et les autres appels. Ce sont des hypothèses sur le trafic, pas une prévision d’économies.
Exécutez le même jeu d’évaluation avant et après le changement. Indiquez les erreurs de qualité, la latence, le taux d’achèvement et le coût total. RouteLLM illustre le routage sous contraintes de qualité dans des expériences précises ; son ratio de coûts historique ne prédit pas votre facture.
Consultez la section optimisation des coûts du LLM Engineering Guide pour les techniques de serving associées.