Formaty kwantyzacji LLM: GGUF, AWQ, GPTQ, FP8 i NF4
Tłumaczenie automatyczne Ten artykuł został automatycznie przetłumaczony z angielskiego oryginału.
GGUF, AWQ, GPTQ, FP8 i NF4 to nie pięć wzajemnie wymiennych formatów plików. GGUF to kontener modelu i format metadanych, powszechnie używany przez llama.cpp. AWQ i GPTQ to metody kwantyzacji po treningu. FP8 to format liczbowy obsługiwany przez wybrane akceleratory i kernele do serwowania. NF4 to czterobitowy typ danych przeznaczony dla wag o rozkładzie normalnym, powszechnie używany podczas treningu QLoRA.
Najpierw wybierz runtime i sprzęt. Następnie wybierz reprezentację obsługiwaną przez przypięty runtime dla konkretnej architektury. Przed zaakceptowaniem mniejszego artefaktu zmierz jakość zadań, pamięć, czas do pierwszego tokena, przepustowość i współbieżność.
Ostatni przegląd: 2026-08-10. Porównanie uwzględnia zgodność z runtime’em, kernele sprzętowe, trening w porównaniu z serwowaniem, pochodzenie artefaktu, pamięć, opóźnienie oraz zmierzoną utratę jakości.
Tabela decyzyjna
| Cel | Najlepszy punkt wyjścia | Co sprawdzić przed użyciem |
|---|---|---|
| Lokalna inferencja na CPU, Metal lub przenośnym llama.cpp | GGUF z udokumentowaną kwantyzacją | Obsługa architektury, szablon czatu, zachowanie kontekstu, receptura kwantyzacji i rewizja źródła. |
| Inferencja na GPU ze skalibrowaną kwantyzacją wag | AWQ lub GPTQ | Silnik serwujący, GPU, szerokość bitowa, rozmiar grupy, kernele i architektura modelu. |
| Serwowanie na obsługiwanym GPU w centrum danych | FP8 | Możliwości sprzętu, implementacja runtime’u, tryb kalibracji i jakość mierzona end-to-end. |
| Trening parametrycznie efektywny ze zamrożonymi wagami 4-bitowymi | NF4 przez bitsandbytes | Typ danych obliczeniowych, kwantyzacja zagnieżdżona, pamięć optymalizatora oraz końcowy artefakt po scaleniu lub artefakt adaptera. |
| Najprostszy prototyp w Transformers | bitsandbytes 8-bit lub 4-bit | Obsługa backendu oraz to, czy ścieżka prototypowa odpowiada serwerowi produkcyjnemu. |
GGUF nie określa jednej kwantyzacji
Rozszerzenie .gguf informuje, w jaki sposób pakowane są tensory i metadane, a nie o precyzji każdego tensora. Nazwy takie jak Q4_K_M identyfikują receptury kwantyzacji llama.cpp, a poszczególne receptury mogą traktować grupy tensorów w różny sposób. Zapisuj oryginalny checkpoint, rewizję konwersji, polecenie kwantyzacji, macierz ważności, jeśli była używana, oraz hashe.
AWQ i GPTQ wymagają zgodnej ścieżki serwowania
Artefakty AWQ i GPTQ zwykle korzystają z Safetensors oraz konfiguracji specyficznej dla danej metody. Model może pobrać się poprawnie, a mimo to przejść na wolny kernel albo zakończyć działanie błędem z powodu nieobsługiwanej architektury. Przed wyborem artefaktu sprawdź aktualną macierz obsługi dla Transformers, vLLM lub używanej wersji właściwego serwera.
FP8 i NF4 rozwiązują różne problemy
FP8 jest atrakcyjny, gdy akcelerator i stos do serwowania implementują go wydajnie. NF4 jest przede wszystkim kojarzony z oszczędnym pamięciowo treningiem adapterów w przepływach pracy w stylu QLoRA. Żadna z tych etykiet nie gwarantuje takiej samej jakości, szybkości ani zużycia pamięci dla różnych modeli i konfiguracji sprzętowych.
Lista kontrolna ewaluacji
- porównaj ten sam źródłowy checkpoint i ten sam zestaw promptów
- uwzględnij długi kontekst i żądania współbieżne
- mierz poprawność schematów i wywołań narzędzi obok perplexity
- rejestruj maksymalne zużycie pamięci urządzenia i hosta
- zweryfikuj czas do pierwszego tokena oraz przepustowość generowania
- przeanalizuj rzadkie lub kosztowne jakościowo podzbiory danych
- przechowuj wraz z artefaktem licencję, rewizję źródła, konwerter, recepturę i hash
Dalsza lektura
- Przewodnik po kwantyzacji modeli omawia algorytmy, kalibrację, kernele oraz kompromisy wdrożeniowe.
- Warianty LLM z otwartymi wagami rozdzielają rolę checkpointu, architekturę, kontener, kwantyzację, runtime i sprzęt.
- Lokalne LLM na macOS pokazują zastosowanie tych wyborów na Apple Silicon.