LLM-serving-frameworks: hoe kies ik een runtime?

Automatische vertaling

Dit artikel is automatisch vertaald vanuit de oorspronkelijke Engelse versie.

Kies een runtime die je specifieke model, quantization en hardware ondersteunt. Test vervolgens de instellingen met het beoogde verkeer. vLLM, SGLang, TensorRT-LLM en llama.cpp zijn bruikbare kandidaten voor verschillende deployments. Geen enkele frameworknaam garandeert de laagste latency voor je werklast.

Controleer de compatibiliteit van het model en de hardware voordat je tijd aan load tests besteedt.

Kies kandidaten op basis van het vereiste gedrag

VereisteTe testen kandidaatTe verzamelen bewijs
Algemene GPU-serving met meerdere verzoekenvLLMThroughput die aan het SLO voldoet en geheugendruk
Veel herhaalde prefixen of gestructureerde generatieSGLang, naast een andere runtime die dit ondersteuntCache-hitpercentage en geldigheid van de uitvoer
NVIDIA-specifieke optimalisatieTensorRT-LLMOndersteuning voor models en precisie, en latency onder belasting
CPU, Apple silicon of draagbare GGUF-uitvoeringllama.cppOf het model past en hoe snel het op de doelmachine draait
Eenvoudige installatie van lokale modelsOllamaOf de lokale workflow de vereiste gelijktijdigheid aankan

Dit zijn vergelijkingen om mee te beginnen, geen exclusieve mogelijkheden. Andere serving-runtimes bieden bijvoorbeeld ook prefix caching en structured output.

vLLM beschrijft serving, geheugenbeheer, taakplanning en deployment-opties. SGLang biedt hergebruik van prefixen en functies voor gestructureerde generatie. De snelstartgids van TensorRT-LLM gebruikt een model-API op hoog niveau en een serving-opdracht; controleer de backend- en modelvereisten in plaats van aan te nemen dat elke deployment een vooraf gebouwde engine nodig heeft.

Hugging Face archiveerde de TGI-repository in maart 2026. De README raadt alternatieve engines aan voor nieuwe projecten.

Vergelijk dezelfde verdeling van verzoeken

Gebruik hetzelfde modelartefact, dezelfde hardware en precisie, en dezelfde prompts en uitvoerlimieten. Test zowel unieke als herhaalde prefixen als caching van belang is. Meet de tijd tot het eerste token, de tijd per uitvoertoken, mislukte verzoeken en throughput bij je latencygrenzen.

Test ook annulering, onjuist gevormde invoer, gelijktijdige lange verzoeken en het gedrag bij een herstart. Een runtime die slaagt voor een korte test met één verzoek kan onder belasting andere toelatingslimieten nodig hebben.

De vergelijking van serving-frameworks in de LLM Engineering Guide verbindt de runtimekeuze met inference-optimalisaties.