Comment réduire les coûts des LLM sans dégrader la qualité des réponses ?

Traduction automatique

Cet article a été traduit automatiquement depuis la version originale en anglais.

Mesurez le coût par tâche réussie, puis testez les limites de sortie, la mise en cache, le traitement par lots ou des modèles moins chers sur un jeu d’évaluation réservé. Une facture de tokens plus faible n’est utile que si le système respecte toujours ses exigences de qualité et de latence. Commencez par le travail répété ou les groupes de requêtes coûteux visibles dans vos données d’utilisation.

Établir le coût réel

Pour une API dont les tarifs sont exprimés par million de tokens, le coût simplifié d’une requête sans cache est :

cost=input tokens×input price+output tokens×output price106\text{cost} = \frac{\text{input tokens} \times \text{input price} + \text{output tokens} \times \text{output price}}{10^6}

Utilisez les tarifs actuels, par exemple ceux de la documentation tarifaire d’OpenAI. Comptabilisez séparément les tarifs des entrées en cache, les frais des outils et les nouvelles tentatives. Comparez la somme de tous les appels nécessaires pour terminer une tâche, y compris le routage et la validation.

Pour un hébergement sur votre propre infrastructure, incluez le temps GPU, la capacité inutilisée, le stockage, le réseau, l’exploitation et l’ingénierie. Diviser uniquement le coût de location des GPU par les tokens générés peut masquer des coûts importants.

Appliquer le changement au trafic adapté

ChangementOù il peut être utilePoints à vérifier
Sorties plus courtesRéponses contenant des détails inutilesExhaustivité et erreurs de troncature
Mise en cache des préfixesPréfixes de prompts compatibles et répétésTaux de succès du cache, conditions du fournisseur et mémoire conservée
Traitement par lotsTravail pouvant attendreDélai d’achèvement et gestion des échecs
Routage des modèlesRequêtes auxquelles un modèle moins cher peut répondreRequêtes mal orientées, coût du routeur et qualité de bout en bout
QuantificationCouples modèle/runtime compatibles hébergés sur votre infrastructureQualité, débit, mémoire et taille de lot utilisable

Ne retirez pas les éléments probants récupérés uniquement pour raccourcir un prompt. Vérifiez si le contexte manquant augmente les réponses incorrectes ou les nouvelles tentatives.

Comparer des tâches complètes

Supposons qu’une charge de travail hypothétique envoie 70% des requêtes à un modèle moins cher et 30% à un modèle plus performant. Le coût de ses appels aux modèles est 0.7 × cheap cost + 0.3 × strong cost, auquel s’ajoutent le routage, les nouvelles tentatives et les autres appels. Ce sont des hypothèses sur le trafic, pas une prévision d’économies.

Exécutez le même jeu d’évaluation avant et après le changement. Indiquez les erreurs de qualité, la latence, le taux d’achèvement et le coût total. RouteLLM illustre le routage sous contraintes de qualité dans des expériences précises ; son ratio de coûts historique ne prédit pas votre facture.

Consultez la section optimisation des coûts du LLM Engineering Guide pour les techniques de serving associées.