Фреймворки для сервинга LLM: как выбрать рантайм?
Автоматический перевод
Эта статья была автоматически переведена с оригинальной английской версии.
Выберите рантайм, который поддерживает именно вашу модель, квантизацию и оборудование, затем проверьте его настройки на бенчмарках с предполагаемым трафиком. vLLM, SGLang, TensorRT-LLM и llama.cpp подходят для разных деплоев. Название фреймворка не гарантирует минимальную латентность на вашей нагрузке.
Проверьте совместимость модели и оборудования, прежде чем тратить время на нагрузочные тесты.
Выбирайте кандидатов по требуемому поведению
| Требование | Кандидат для проверки | Какие данные собрать |
|---|---|---|
| Универсальный сервинг на GPU с несколькими запросами | vLLM | throughput в пределах SLO и нагрузка на память |
| Много повторяющихся префиксов или структурированная генерация | SGLang вместе с другим рантаймом, поддерживающим эти функции | Доля попаданий в кэш и корректность вывода |
| Оптимизация под NVIDIA | TensorRT-LLM | Поддержка моделей и точности вычислений, латентность под нагрузкой |
| CPU, Apple silicon или переносимое выполнение GGUF | llama.cpp | Помещается ли модель в память и как быстро работает на целевой машине |
| Простая настройка локальной модели | Ollama | Обеспечивает ли локальный рабочий процесс нужное число одновременных запросов |
Это начальные сравнения, а не исключительные возможности. Например, prefix caching и structured output есть и в других рантаймах для сервинга.
vLLM документирует сервинг, управление памятью, планирование и варианты деплоя. SGLang включает повторное использование префиксов и функции структурированной генерации. Краткое руководство по TensorRT-LLM использует высокоуровневый API моделей и команду для сервинга; проверьте требования бэкенда и модели, а не исходите из того, что каждому деплою нужен заранее собранный движок.
Hugging Face архивировала репозиторий TGI в марте 2026 года. Его README рекомендует альтернативные движки для новых проектов.
Сравнивайте на одинаковом распределении запросов
Используйте один и тот же артефакт модели, оборудование, точность вычислений, промпты и ограничения вывода. Если кэширование важно, проверьте как уникальные, так и повторяющиеся префиксы. Фиксируйте время до первого токена, время на выходной токен, ошибки запросов и throughput при заданных порогах латентности.
Также проверьте отмену запросов, некорректные входные данные, одновременные длинные запросы и поведение при перезапуске. Рантайму, который проходит короткий тест с одним запросом, под нагрузкой могут понадобиться другие ограничения на приём запросов.
Сравнение фреймворков для сервинга в LLM Engineering Guide связывает выбор рантайма с оптимизациями инференса.