LLM-Serving-Frameworks: Wie wähle ich eine Runtime?
Automatische Übersetzung
Dieser Artikel wurde automatisch aus der englischen Originalversion übersetzt.
Wähle eine Runtime, die dein konkretes Model, deine Quantization und deine Hardware unterstützt. Prüfe dann ihre Einstellungen mit Benchmarks unter dem vorgesehenen Traffic. vLLM, SGLang, TensorRT-LLM und llama.cpp sind geeignete Kandidaten für unterschiedliche Deployments. Kein Framework-Name garantiert die niedrigste Latency für deine Workload.
Prüfe die Kompatibilität von Model und Hardware, bevor du Zeit in Load Tests investierst.
Wähle Kandidaten anhand des benötigten Verhaltens
| Anforderung | Zu testender Kandidat | Zu erhebende Nachweise |
|---|---|---|
| Allgemeines GPU-Serving mit mehreren Anfragen | vLLM | Throughput innerhalb der SLO-Vorgaben und Speicherauslastung |
| Viele wiederholte Präfixe oder strukturierte Generierung | SGLang, zusammen mit einer weiteren unterstützenden Runtime | Cache-Trefferrate und Gültigkeit der Ausgabe |
| NVIDIA-spezifische Optimierung | TensorRT-LLM | Unterstützte Models und Präzision sowie Latency unter Last |
| CPU, Apple silicon oder portable GGUF-Ausführung | llama.cpp | Ob das Model in den Speicher passt und wie schnell es auf dem Zielrechner läuft |
| Einfache Einrichtung lokaler Models | Ollama | Ob der lokale Workflow die erforderliche Parallelität erfüllt |
Diese Vergleiche dienen als Ausgangspunkt und beschreiben keine exklusiven Fähigkeiten. Beispielsweise bieten auch andere Serving-Runtimes Prefix Caching und Structured Output.
vLLM dokumentiert Serving, Speicherverwaltung, Scheduling und Deployment-Optionen. SGLang bietet die Wiederverwendung von Präfixen und Funktionen zur strukturierten Generierung. Die Schnellstartanleitung von TensorRT-LLM verwendet eine Model-API auf hoher Abstraktionsebene und einen Serving-Befehl. Prüfe die Backend- und Model-Anforderungen, statt anzunehmen, dass jedes Deployment eine vorab erstellte Engine benötigt.
Hugging Face hat das TGI-Repository im März 2026 archiviert. Die README empfiehlt für neue Projekte alternative Engines.
Vergleiche dieselbe Verteilung von Anfragen
Verwende dasselbe Model-Artefakt, dieselbe Hardware und Präzision sowie dieselben Prompts und Ausgabelimits. Teste sowohl einmalige als auch wiederholte Präfixe, wenn Caching relevant ist. Erfasse die Zeit bis zum ersten Token, die Zeit pro Ausgabe-Token, fehlgeschlagene Anfragen und den Throughput bei deinen Latency-Grenzwerten.
Teste auch den Abbruch von Anfragen, fehlerhafte Eingaben, gleichzeitig laufende lange Anfragen und das Verhalten beim Neustart. Eine Runtime, die einen kurzen Test mit einer einzelnen Anfrage besteht, benötigt unter Last möglicherweise andere Limits für die Annahme von Anfragen.
Der Vergleich von Serving-Frameworks im LLM Engineering Guide verbindet die Runtime-Wahl mit Inference-Optimierungen.