Фреймворки для сервинга LLM: как выбрать рантайм?

Автоматический перевод

Эта статья была автоматически переведена с оригинальной английской версии.

Выберите рантайм, который поддерживает именно вашу модель, квантизацию и оборудование, затем проверьте его настройки на бенчмарках с предполагаемым трафиком. vLLM, SGLang, TensorRT-LLM и llama.cpp подходят для разных деплоев. Название фреймворка не гарантирует минимальную латентность на вашей нагрузке.

Проверьте совместимость модели и оборудования, прежде чем тратить время на нагрузочные тесты.

Выбирайте кандидатов по требуемому поведению

ТребованиеКандидат для проверкиКакие данные собрать
Универсальный сервинг на GPU с несколькими запросамиvLLMthroughput в пределах SLO и нагрузка на память
Много повторяющихся префиксов или структурированная генерацияSGLang вместе с другим рантаймом, поддерживающим эти функцииДоля попаданий в кэш и корректность вывода
Оптимизация под NVIDIATensorRT-LLMПоддержка моделей и точности вычислений, латентность под нагрузкой
CPU, Apple silicon или переносимое выполнение GGUFllama.cppПомещается ли модель в память и как быстро работает на целевой машине
Простая настройка локальной моделиOllamaОбеспечивает ли локальный рабочий процесс нужное число одновременных запросов

Это начальные сравнения, а не исключительные возможности. Например, prefix caching и structured output есть и в других рантаймах для сервинга.

vLLM документирует сервинг, управление памятью, планирование и варианты деплоя. SGLang включает повторное использование префиксов и функции структурированной генерации. Краткое руководство по TensorRT-LLM использует высокоуровневый API моделей и команду для сервинга; проверьте требования бэкенда и модели, а не исходите из того, что каждому деплою нужен заранее собранный движок.

Hugging Face архивировала репозиторий TGI в марте 2026 года. Его README рекомендует альтернативные движки для новых проектов.

Сравнивайте на одинаковом распределении запросов

Используйте один и тот же артефакт модели, оборудование, точность вычислений, промпты и ограничения вывода. Если кэширование важно, проверьте как уникальные, так и повторяющиеся префиксы. Фиксируйте время до первого токена, время на выходной токен, ошибки запросов и throughput при заданных порогах латентности.

Также проверьте отмену запросов, некорректные входные данные, одновременные длинные запросы и поведение при перезапуске. Рантайму, который проходит короткий тест с одним запросом, под нагрузкой могут понадобиться другие ограничения на приём запросов.

Сравнение фреймворков для сервинга в LLM Engineering Guide связывает выбор рантайма с оптимизациями инференса.