LLM Quantization Formats: GGUF, AWQ, GPTQ, FP8 en NF4
Automatische vertaling Dit artikel is automatisch vertaald vanuit de oorspronkelijke Engelse versie.
GGUF, AWQ, GPTQ, FP8 en NF4 zijn geen vijf onderling uitwisselbare bestandsformaten. GGUF is een modelcontainer- en metadataformaat dat vaak wordt gebruikt door llama.cpp. AWQ en GPTQ zijn post-training quantization-methoden. FP8 is een numeriek formaat dat wordt gebruikt door ondersteunde accelerators en serving-kernels. NF4 is een datatype van vier bits dat is ontworpen voor normaal verdeelde weights en vaak wordt gebruikt voor QLoRA-training.
Kies eerst de runtime en hardware. Kies vervolgens een representatie die de vastgelegde runtime voor de exacte architecture ondersteunt. Benchmark taskkwaliteit, geheugengebruik, time to first token, throughput en concurrency voordat je het kleinere artifact accepteert.
Laatst beoordeeld: 2026-08-10. In deze vergelijking staan runtimecompatibiliteit, hardware-kernels, training versus serving, artifact provenance, geheugen, latency en gemeten kwaliteitsverlies centraal.
Beslistabel
| Doel | Beste startpunt | Controleer vóór gebruik |
|---|---|---|
| Lokale inference op CPU, Metal of draagbare llama.cpp | GGUF met gedocumenteerde quantization | Ondersteuning voor de architecture, chat template, contextgedrag, quantization recipe en source revision. |
| GPU-inference met gekalibreerde weight quantization | AWQ of GPTQ | De serving-engine, GPU, bitbreedte, group size, kernels en model architecture. |
| Serving op ondersteunde data-center-GPU’s | FP8 | Hardwaremogelijkheden, runtime-implementatie, calibration mode en end-to-endkwaliteit. |
| Parameter-efficient training met bevroren 4-bit weights | NF4 via bitsandbytes | Compute dtype, nested quantization, optimizergeheugen en het uiteindelijke merged of adapter-artifact. |
| Eenvoudigste Transformers-prototype | bitsandbytes 8-bit of 4-bit | Backendondersteuning en of de prototype-route overeenkomt met de production server. |
GGUF specificeert niet één quantization
Een .gguf-extensie geeft aan hoe tensors en metadata worden verpakt, niet wat de precision van elke tensor is. Namen zoals Q4_K_M identificeren llama.cpp quantization recipes, en die recipes kunnen tensor groups verschillend behandelen. Leg het oorspronkelijke checkpoint, de conversion revision, het quantization command, de importance matrix indien gebruikt en de hashes vast.
AWQ en GPTQ vereisen een bijpassende serving-route
AWQ- en GPTQ-artifacts gebruiken doorgaans Safetensors plus methodespecifieke configuratie. Een model kan succesvol worden gedownload en toch terugvallen op een trage kernel of mislukken op een niet-ondersteunde architecture. Controleer de actuele support matrix voor Transformers, vLLM of de daadwerkelijke serverversie voordat je het artifact selecteert.
FP8 en NF4 lossen verschillende problemen op
FP8 is aantrekkelijk wanneer de accelerator en serving stack het efficiënt implementeren. NF4 wordt vooral geassocieerd met geheugenefficiënte adapter training via QLoRA-achtige workflows. Geen van beide labels garandeert dezelfde kwaliteit, snelheid of hetzelfde geheugengebruik voor verschillende modellen en hardware.
Evaluatiechecklist
- vergelijk hetzelfde source checkpoint en dezelfde promptset
- neem long-context- en concurrente requests op
- meet schema- en tool-call-correctheid naast perplexity
- registreer piekgeheugen op device en host
- verifieer time to first token en output-throughput
- inspecteer zeldzame of kostbare quality slices
- bewaar license, source revision, converter, recipe en hash bij het artifact
Verdiepende lectuur
- Model Quantization Guide behandelt algorithms, calibration, kernels en trade-offs bij deployment.
- Open-Weight LLM Variants maakt onderscheid tussen checkpointrol, architecture, container, quantization, runtime en hardware.
- Local LLMs on macOS past deze keuzes toe op Apple Silicon.