Hoe moeten LLM APIs verzoeken, tokens en gelijktijdige verwerking beperken?

Automatische vertaling

Dit artikel is automatisch vertaald vanuit de oorspronkelijke Engelse versie.

Een LLM API heeft aparte limieten nodig voor het aantal verzoeken, het tokenvolume en gelijktijdig werk. Verzoeken per minuut alleen kunnen een dienst niet beschermen als de lengte van prompts en gegenereerde uitvoer varieert. Voeg invoer- en uitvoerlimieten per verzoek toe en toets vervolgens de toelatingslimieten aan de beoogde latency.

Waarom het aantal verzoeken niet voldoende is

Een prompt van 10 tokens en een prompt van 100,000 tokens verschillen in invoerlengte met een factor 10,000. Hun totale kosten hangen ook af van de uitvoerlengte, het model en caching. Een limiet die ze gelijk behandelt, kan meer werk toelaten dan de dienst kan verwerken.

Combineer meerdere beperkingen:

LimietWat deze beperkt
Verzoeken per minuutAantal aanroepen, waaronder veel kleine verzoeken
Invoer- en uitvoertokensVariabel verwerkingsvolume en variabele kosten
Gelijktijdige verzoekenActief werk dat decode-capaciteit en KV-geheugen gebruikt
Tokens per verzoekAfzonderlijke prompts of uitvoer die de geteste grenzen overschrijden

Pas limieten per tenant toe vóór een gedeelde limiet voor de hele dienst, zodat één tenant niet alle beschikbare capaciteit kan gebruiken.

Hoe tokenreservering werkt

Een mogelijk applicatiebeleid reserveert bij toelating het geschatte aantal invoertokens plus de maximaal toegestane uitvoer. Een verzoek met 2,000 invoertokens en een uitvoerlimiet van 1,000 reserveert 3,000 tokens. Als het 200 uitvoertokens produceert, is het werkelijke gebruik 2,200; de applicatie geeft 800 terug.

Houd dit voorbeeld gescheiden van de registratie van verbruik door de aanbieder. OpenAI documenteert zijn eigen schattingen voor verzoek- en tokenquota. Anthropic documenteert aparte limieten voor invoer- en uitvoertokens. Een lokale reservering voorspelt niet welk aanbiedersquotum een verzoek verbruikt. Verreken onderbroken verzoeken zodra gebruiksgegevens beschikbaar zijn en begrens reserveringen die niet kunnen worden verrekend.

Wat je onder belasting moet controleren

Combineer korte en lange prompts, korte en lange uitvoer en gelijktijdig actieve tenants. Registreer wachttijd in de wachtrij, geweigerde verzoeken, TTFT, TPOT en KV-cache-gebruik. Laat verzoeken alleen gedurende een begrensde tijd wachten; weiger ze anders met een duidelijk beleid voor nieuwe pogingen. Een budget voor tokens per minuut kan nog steeds een plotselinge piek toelaten die de geheugencapaciteit voor gelijktijdige verzoeken overschrijdt.

Lees voor het bredere ontwerp het beperken van verzoekfrequenties in de LLM Engineering Guide.