Frameworki do udostępniania LLM: jak wybrać środowisko wykonawcze?
Tłumaczenie automatyczne
Ten artykuł został automatycznie przetłumaczony z angielskiego oryginału.
Wybierz środowisko wykonawcze, które obsługuje dokładnie twój model, kwantyzację i sprzęt, a następnie przetestuj jego ustawienia przy docelowym ruchu. vLLM, SGLang, TensorRT-LLM i llama.cpp to przydatni kandydaci dla różnych wdrożeń. Nazwa frameworka nie gwarantuje najniższego opóźnienia dla twojego obciążenia.
Sprawdź zgodność modelu i sprzętu, zanim poświęcisz czas na testy obciążeniowe.
Wybierz kandydatów według wymaganego zachowania
| Wymaganie | Kandydat do przetestowania | Dane do zebrania |
|---|---|---|
| Ogólne udostępnianie na GPU z obsługą wielu żądań | vLLM | Przepustowość zgodna z SLO i obciążenie pamięci |
| Wiele powtarzających się prefiksów lub generowanie ustrukturyzowanych danych | SGLang wraz z innym środowiskiem obsługującym te funkcje | Współczynnik trafień w pamięci podręcznej i poprawność wyjścia |
| Optymalizacja dla NVIDIA | TensorRT-LLM | Obsługa modeli i precyzji oraz opóźnienie pod obciążeniem |
| CPU, Apple silicon lub przenośne wykonywanie GGUF | llama.cpp | Czy model mieści się w pamięci i jak szybko działa na docelowej maszynie |
| Prosta konfiguracja lokalnego modelu | Ollama | Czy lokalny przepływ pracy obsługuje wymaganą liczbę równoczesnych żądań |
To porównania na początek, a nie funkcje dostępne wyłącznie w tych rozwiązaniach. Na przykład buforowanie prefiksów i ustrukturyzowane dane wyjściowe są dostępne także w innych środowiskach do udostępniania modeli.
vLLM dokumentuje udostępnianie modeli, zarządzanie pamięcią, planowanie i opcje wdrożenia. SGLang obejmuje ponowne wykorzystanie prefiksów i funkcje generowania ustrukturyzowanych danych. Instrukcja szybkiego startu TensorRT-LLM korzysta z API modeli wysokiego poziomu i polecenia do udostępniania modeli; sprawdź wymagania backendu i modelu, zamiast zakładać, że każde wdrożenie wymaga wcześniej zbudowanego silnika.
Hugging Face zarchiwizowała repozytorium TGI w marcu 2026. Jego README zaleca alternatywne silniki do nowych projektów.
Porównuj ten sam rozkład żądań
Użyj tego samego artefaktu modelu, sprzętu, precyzji, promptów i limitów wyjścia. Testuj zarówno unikalne, jak i powtarzające się prefiksy, jeśli buforowanie ma znaczenie. Zapisuj czas do pierwszego tokenu, czas na token wyjściowy, błędy żądań i przepustowość przy swoich progach opóźnienia.
Przetestuj też anulowanie, nieprawidłowe dane wejściowe, równoczesne długie żądania i zachowanie przy ponownym uruchomieniu. Środowisko, które przechodzi krótki test z jednym żądaniem, może wymagać innych limitów przyjmowania żądań pod obciążeniem.
Porównanie frameworków do udostępniania modeli w LLM Engineering Guide łączy wybór środowiska wykonawczego z optymalizacjami inferencji.