Wie senkt man LLM-Kosten, ohne die Antwortqualität zu verschlechtern?
Automatische Übersetzung
Dieser Artikel wurde automatisch aus der englischen Originalversion übersetzt.
Messen Sie die Kosten pro erfolgreich abgeschlossener Aufgabe. Testen Sie dann Ausgabelimits, Caching, Batch-Verarbeitung oder günstigere Models an einem zurückgehaltenen Evaluierungsdatensatz. Niedrigere Token-Kosten sind nur dann nützlich, wenn das System weiterhin seine Anforderungen an Qualität und Latency erfüllt. Beginnen Sie mit wiederholten Arbeitsschritten oder teuren Anfragegruppen, die Ihre Nutzungsdaten zeigen.
Die tatsächlichen Kosten ermitteln
Für eine API mit Preisen pro Million Tokens ergeben sich die vereinfachten Kosten einer Anfrage ohne Caching wie folgt:
Verwenden Sie aktuelle Tarife, etwa aus der OpenAI-Preisdokumentation. Berücksichtigen Sie Preise für gecachte Eingaben, Werkzeuggebühren und Wiederholungsversuche separat. Vergleichen Sie die Summe aller Aufrufe, die zum Abschluss einer Aufgabe nötig sind, einschließlich Routing und Validierung.
Berücksichtigen Sie beim Selbsthosting GPU-Zeit, ungenutzte Kapazität, Speicher, Netzwerk, Betrieb und Entwicklungsarbeit. Wenn Sie nur die GPU-Miete durch die generierten Tokens teilen, können erhebliche Kosten unberücksichtigt bleiben.
Die Änderung auf geeignete Anfragen abstimmen
| Änderung | Wo sie helfen kann | Was zu prüfen ist |
|---|---|---|
| Kürzere Ausgaben | Antworten mit unnötigen Details | Vollständigkeit und Fehler durch abgeschnittene Ausgaben |
| Prefix Caching | Wiederholte kompatible Prompt-Präfixe | Trefferrate, Bedingungen des Anbieters und belegter Speicher |
| Batch-Verarbeitung | Aufgaben, die warten können | Zeitfenster für den Abschluss und Fehlerbehandlung |
| Model Routing | Anfragen, die ein günstigeres Model beantworten kann | Falsch zugeordnete Anfragen, Router-Kosten und Qualität des Gesamtablaufs |
| Quantization | Unterstützte Kombinationen selbst gehosteter Models und Runtimes | Qualität, Throughput, Speicher und nutzbare Batch-Größe |
Entfernen Sie keine abgerufenen Belege, nur um einen Prompt zu kürzen. Prüfen Sie, ob der fehlende Kontext zu mehr falschen Antworten oder Wiederholungsversuchen führt.
Vollständige Aufgaben vergleichen
Angenommen, eine hypothetische Arbeitslast sendet 70% der Anfragen an ein günstigeres Model und 30% an ein leistungsfähigeres Model. Die Kosten ihrer Model-Aufrufe betragen 0.7 × cheap cost + 0.3 × strong cost, zuzüglich Routing, Wiederholungsversuchen und anderen Aufrufen. Das sind Annahmen über die Anfragen, keine prognostizierte Einsparung.
Führen Sie vor und nach der Änderung die Evaluierung mit demselben Datensatz durch. Berichten Sie Qualitätsfehler, Latency, Abschlussrate und Gesamtkosten. RouteLLM zeigt in bestimmten Experimenten Routing unter Qualitätsvorgaben; sein historisches Kostenverhältnis sagt Ihre Rechnung nicht voraus.
Lesen Sie zur Vertiefung der verwandten Serving-Techniken den Abschnitt Kostenoptimierung im LLM Engineering Guide.