LLM-serving-frameworks: hoe kies ik een runtime?
Automatische vertaling
Dit artikel is automatisch vertaald vanuit de oorspronkelijke Engelse versie.
Kies een runtime die je specifieke model, quantization en hardware ondersteunt. Test vervolgens de instellingen met het beoogde verkeer. vLLM, SGLang, TensorRT-LLM en llama.cpp zijn bruikbare kandidaten voor verschillende deployments. Geen enkele frameworknaam garandeert de laagste latency voor je werklast.
Controleer de compatibiliteit van het model en de hardware voordat je tijd aan load tests besteedt.
Kies kandidaten op basis van het vereiste gedrag
| Vereiste | Te testen kandidaat | Te verzamelen bewijs |
|---|---|---|
| Algemene GPU-serving met meerdere verzoeken | vLLM | Throughput die aan het SLO voldoet en geheugendruk |
| Veel herhaalde prefixen of gestructureerde generatie | SGLang, naast een andere runtime die dit ondersteunt | Cache-hitpercentage en geldigheid van de uitvoer |
| NVIDIA-specifieke optimalisatie | TensorRT-LLM | Ondersteuning voor models en precisie, en latency onder belasting |
| CPU, Apple silicon of draagbare GGUF-uitvoering | llama.cpp | Of het model past en hoe snel het op de doelmachine draait |
| Eenvoudige installatie van lokale models | Ollama | Of de lokale workflow de vereiste gelijktijdigheid aankan |
Dit zijn vergelijkingen om mee te beginnen, geen exclusieve mogelijkheden. Andere serving-runtimes bieden bijvoorbeeld ook prefix caching en structured output.
vLLM beschrijft serving, geheugenbeheer, taakplanning en deployment-opties. SGLang biedt hergebruik van prefixen en functies voor gestructureerde generatie. De snelstartgids van TensorRT-LLM gebruikt een model-API op hoog niveau en een serving-opdracht; controleer de backend- en modelvereisten in plaats van aan te nemen dat elke deployment een vooraf gebouwde engine nodig heeft.
Hugging Face archiveerde de TGI-repository in maart 2026. De README raadt alternatieve engines aan voor nieuwe projecten.
Vergelijk dezelfde verdeling van verzoeken
Gebruik hetzelfde modelartefact, dezelfde hardware en precisie, en dezelfde prompts en uitvoerlimieten. Test zowel unieke als herhaalde prefixen als caching van belang is. Meet de tijd tot het eerste token, de tijd per uitvoertoken, mislukte verzoeken en throughput bij je latencygrenzen.
Test ook annulering, onjuist gevormde invoer, gelijktijdige lange verzoeken en het gedrag bij een herstart. Een runtime die slaagt voor een korte test met één verzoek kan onder belasting andere toelatingslimieten nodig hebben.
De vergelijking van serving-frameworks in de LLM Engineering Guide verbindt de runtimekeuze met inference-optimalisaties.