Formaty kwantyzacji LLM: GGUF, AWQ, GPTQ, FP8 i NF4

Tłumaczenie automatyczne Ten artykuł został automatycznie przetłumaczony z angielskiego oryginału.

GGUF, AWQ, GPTQ, FP8 i NF4 to nie pięć wzajemnie wymiennych formatów plików. GGUF to kontener modelu i format metadanych, powszechnie używany przez llama.cpp. AWQ i GPTQ to metody kwantyzacji po treningu. FP8 to format liczbowy obsługiwany przez wybrane akceleratory i kernele do serwowania. NF4 to czterobitowy typ danych przeznaczony dla wag o rozkładzie normalnym, powszechnie używany podczas treningu QLoRA.

Najpierw wybierz runtime i sprzęt. Następnie wybierz reprezentację obsługiwaną przez przypięty runtime dla konkretnej architektury. Przed zaakceptowaniem mniejszego artefaktu zmierz jakość zadań, pamięć, czas do pierwszego tokena, przepustowość i współbieżność.

Ostatni przegląd: 2026-08-10. Porównanie uwzględnia zgodność z runtime’em, kernele sprzętowe, trening w porównaniu z serwowaniem, pochodzenie artefaktu, pamięć, opóźnienie oraz zmierzoną utratę jakości.

Tabela decyzyjna

CelNajlepszy punkt wyjściaCo sprawdzić przed użyciem
Lokalna inferencja na CPU, Metal lub przenośnym llama.cppGGUF z udokumentowaną kwantyzacjąObsługa architektury, szablon czatu, zachowanie kontekstu, receptura kwantyzacji i rewizja źródła.
Inferencja na GPU ze skalibrowaną kwantyzacją wagAWQ lub GPTQSilnik serwujący, GPU, szerokość bitowa, rozmiar grupy, kernele i architektura modelu.
Serwowanie na obsługiwanym GPU w centrum danychFP8Możliwości sprzętu, implementacja runtime’u, tryb kalibracji i jakość mierzona end-to-end.
Trening parametrycznie efektywny ze zamrożonymi wagami 4-bitowymiNF4 przez bitsandbytesTyp danych obliczeniowych, kwantyzacja zagnieżdżona, pamięć optymalizatora oraz końcowy artefakt po scaleniu lub artefakt adaptera.
Najprostszy prototyp w Transformersbitsandbytes 8-bit lub 4-bitObsługa backendu oraz to, czy ścieżka prototypowa odpowiada serwerowi produkcyjnemu.

GGUF nie określa jednej kwantyzacji

Rozszerzenie .gguf informuje, w jaki sposób pakowane są tensory i metadane, a nie o precyzji każdego tensora. Nazwy takie jak Q4_K_M identyfikują receptury kwantyzacji llama.cpp, a poszczególne receptury mogą traktować grupy tensorów w różny sposób. Zapisuj oryginalny checkpoint, rewizję konwersji, polecenie kwantyzacji, macierz ważności, jeśli była używana, oraz hashe.

AWQ i GPTQ wymagają zgodnej ścieżki serwowania

Artefakty AWQ i GPTQ zwykle korzystają z Safetensors oraz konfiguracji specyficznej dla danej metody. Model może pobrać się poprawnie, a mimo to przejść na wolny kernel albo zakończyć działanie błędem z powodu nieobsługiwanej architektury. Przed wyborem artefaktu sprawdź aktualną macierz obsługi dla Transformers, vLLM lub używanej wersji właściwego serwera.

FP8 i NF4 rozwiązują różne problemy

FP8 jest atrakcyjny, gdy akcelerator i stos do serwowania implementują go wydajnie. NF4 jest przede wszystkim kojarzony z oszczędnym pamięciowo treningiem adapterów w przepływach pracy w stylu QLoRA. Żadna z tych etykiet nie gwarantuje takiej samej jakości, szybkości ani zużycia pamięci dla różnych modeli i konfiguracji sprzętowych.

Lista kontrolna ewaluacji

  • porównaj ten sam źródłowy checkpoint i ten sam zestaw promptów
  • uwzględnij długi kontekst i żądania współbieżne
  • mierz poprawność schematów i wywołań narzędzi obok perplexity
  • rejestruj maksymalne zużycie pamięci urządzenia i hosta
  • zweryfikuj czas do pierwszego tokena oraz przepustowość generowania
  • przeanalizuj rzadkie lub kosztowne jakościowo podzbiory danych
  • przechowuj wraz z artefaktem licencję, rewizję źródła, konwerter, recepturę i hash

Dalsza lektura

Referencje