Wie sollten LLM APIs Anfragen, Tokens und parallele Verarbeitung begrenzen?

Automatische Übersetzung

Dieser Artikel wurde automatisch aus der englischen Originalversion übersetzt.

Eine LLM API braucht getrennte Limits für die Anzahl der Anfragen, das Token-Volumen und die parallele Verarbeitung. Anfragen pro Minute allein können einen Dienst nicht schützen, wenn Prompt-Längen und generierte Ausgaben variieren. Ergänze Obergrenzen für Eingabe und Ausgabe pro Anfrage und teste dann die Annahmelimits gegen die angestrebte Latency.

Warum die Anzahl der Anfragen nicht ausreicht

Ein Prompt mit 10 Tokens und ein Prompt mit 100,000 Tokens unterscheiden sich in ihrer Eingabelänge um den Faktor 10,000. Ihre Gesamtkosten hängen außerdem von Ausgabelänge, Model und Caching ab. Ein Limit, das beide gleich behandelt, kann mehr Arbeit zulassen, als der Dienst verarbeiten kann.

Kombiniere mehrere Begrenzungen:

LimitWas es begrenzt
Anfragen pro MinuteAufrufvolumen, einschließlich vieler kleiner Anfragen
Eingabe- und Ausgabe-TokensVariables Verarbeitungsvolumen und variable Kosten
Parallele AnfragenAktive Verarbeitung, die Decode-Kapazität und KV-Speicher benötigt
Tokens pro AnfrageEinzelne Prompts oder Ausgaben, die die getesteten Grenzen überschreiten

Wende Limits pro Mandant vor einem gemeinsamen dienstweiten Limit an, damit ein Mandant nicht die gesamte verfügbare Kapazität verbrauchen kann.

Wie die Token-Reservierung funktioniert

Eine mögliche Anwendungsrichtlinie reserviert bei der Annahme die geschätzten Eingabe-Tokens plus die maximal erlaubte Ausgabe. Eine Anfrage mit 2,000 Eingabe-Tokens und einer Ausgabeobergrenze von 1,000 reserviert 3,000 Tokens. Erzeugt sie 200 Ausgabe-Tokens, beträgt der tatsächliche Verbrauch 2,200; die Anwendung gibt 800 zurück.

Betrachte dieses Beispiel getrennt von der Abrechnung des Anbieters. OpenAI dokumentiert seine eigenen Schätzungen für Anfrage- und Token-Quoten. Anthropic dokumentiert getrennte Limits für Eingabe- und Ausgabe-Tokens. Eine lokale Reservierung sagt nicht voraus, welche Anbieterquote eine Anfrage verbraucht. Gleiche unterbrochene Anfragen ab, sobald Verbrauchsdaten verfügbar sind, und begrenze Reservierungen, die sich nicht abgleichen lassen.

Was du unter Last prüfen solltest

Mische kurze und lange Prompts, kurze und lange Ausgaben sowie gleichzeitig aktive Mandanten. Erfasse Wartezeit in der Warteschlange, abgelehnte Anfragen, TTFT, TPOT und KV-Cache-Nutzung. Lass Anfragen nur für eine begrenzte Zeit warten; lehne sie andernfalls mit einer klaren Regel für erneute Versuche ab. Ein Budget für Tokens pro Minute kann dennoch einen kurzfristigen Anstieg zulassen, der die Speicherkapazität für parallele Anfragen überschreitet.

Für den umfassenderen Entwurf lies die Begrenzung der Anfragerate im LLM Engineering Guide.