Форматы квантизации LLM: GGUF, AWQ, GPTQ, FP8 и NF4
Автоматический перевод Эта статья была автоматически переведена с оригинальной английской версии.
GGUF, AWQ, GPTQ, FP8 и NF4 — это не пять взаимозаменяемых форматов файлов. GGUF — контейнер и формат метаданных модели, который часто используется в llama.cpp. AWQ и GPTQ — методы квантизации после обучения. FP8 — числовой формат, поддерживаемый некоторыми ускорителями и ядрами сервинга. NF4 — четырёхбитный тип данных, предназначенный для весов с нормальным распределением и часто используемый при обучении с QLoRA.
Сначала выберите рантайм и оборудование. Затем выберите представление, которое поддерживает зафиксированная версия рантайма для конкретной архитектуры. Прежде чем принимать артефакт меньшего размера, проверьте качество на задачах, потребление памяти, время до первого токена, throughput и поддерживаемую конкурентность.
Дата последнего пересмотра: 2026-08-10. В сравнении учитываются совместимость с рантаймом, аппаратные ядра, обучение и сервинг, происхождение артефакта, память, латентность и измеренная потеря качества.
Таблица выбора
| Цель | С чего начать | Что проверить перед использованием |
|---|---|---|
| Локальный инференс на CPU, Metal или переносимом llama.cpp | GGUF с документированной квантизацией | Поддержку архитектуры, шаблон чата, поведение контекстного окна, рецепт квантизации и ревизию исходников. |
| Инференс на GPU с калиброванной квантизацией весов | AWQ или GPTQ | Сервинг-движок, GPU, разрядность, размер группы, ядра и архитектуру модели. |
| Сервинг на поддерживаемом GPU для дата-центров | FP8 | Возможности оборудования, реализацию в рантайме, режим калибровки и качество на всём пайплайне. |
| Параметрически эффективное обучение с замороженными 4-битными весами | NF4 через bitsandbytes | Тип вычислений, nested quantization, память под оптимизатор и финальный объединённый или adapter-артефакт. |
| Самый простой прототип на Transformers | bitsandbytes в 8- или 4-битном режиме | Поддержку бэкенда и соответствие прототипного пути продакшен-серверу. |
GGUF не задаёт одну конкретную квантизацию
Расширение .gguf показывает, как упакованы тензоры и метаданные, но не задаёт точность каждого тензора. Такие имена, как Q4_K_M, обозначают рецепты квантизации llama.cpp; при этом разные рецепты могут по-разному обрабатывать группы тензоров. Фиксируйте исходный чекпоинт, ревизию конвертера, команду квантизации, матрицу важности, если она использовалась, и хэши.
Для AWQ и GPTQ нужен совместимый путь сервинга
Артефакты AWQ и GPTQ обычно используют Safetensors и конфигурацию, специфичную для метода. Модель может успешно скачаться, но при этом перейти на медленное ядро или завершиться с ошибкой из-за неподдерживаемой архитектуры. Перед выбором артефакта проверьте актуальную матрицу поддержки Transformers, vLLM или фактической версии сервера.
FP8 и NF4 решают разные задачи
FP8 особенно привлекателен, когда ускоритель и стек сервинга эффективно его поддерживают. NF4 в первую очередь связан с экономичным по памяти обучением адаптеров в рабочих процессах в стиле QLoRA. Ни одна из этих маркировок не гарантирует одинаковые качество, скорость или потребление памяти для разных моделей и конфигураций оборудования.
Чеклист оценки
- сравнивайте один и тот же исходный чекпоинт и набор промптов
- добавляйте запросы с длинным контекстом и конкурентные запросы
- измеряйте корректность JSON Schema и tool call наряду с perplexity
- фиксируйте пиковое потребление памяти на устройстве и хосте
- проверяйте время до первого токена и throughput генерации
- анализируйте редкие или критичные срезы качества
- храните вместе с артефактом лицензию, ревизию исходников, конвертер, рецепт и хэш
Дополнительные материалы
- Руководство по квантизации моделей охватывает алгоритмы, калибровку, ядра и компромиссы при деплое.
- Варианты LLM с открытыми весами разделяет роли чекпоинта, архитектуру, контейнер, квантизацию, рантайм и оборудование.
- Локальные LLM на macOS показывает применение этих решений на Apple Silicon.