Formatos de cuantización de LLM: GGUF, AWQ, GPTQ, FP8 y NF4

Traducción automática Este artículo se tradujo automáticamente a partir de la versión original en inglés.

GGUF, AWQ, GPTQ, FP8 y NF4 no son cinco formatos de archivo intercambiables. GGUF es un formato de contenedor y metadatos que se usa habitualmente con llama.cpp. AWQ y GPTQ son métodos de post-training quantization. FP8 es un formato numérico utilizado por aceleradores y serving kernels compatibles. NF4 es un tipo de dato de cuatro bits diseñado para pesos con distribución normal, y se usa habitualmente en training con QLoRA.

Elige primero el runtime y el hardware. Después, selecciona una representación compatible con el runtime fijado para esa arquitectura concreta. Haz benchmark de la calidad de las tareas, la memoria, el tiempo hasta el primer token, el throughput y la concurrencia antes de aceptar el artifact de menor tamaño.

Última revisión: 10-08-2026. La comparación prioriza la compatibilidad del runtime, los kernels del hardware, training frente a serving, la procedencia del artifact, la memoria, la latencia y la pérdida de calidad medida.

Tabla de decisión

ObjetivoMejor punto de partidaComprobaciones previas
Inferencia local con CPU, Metal o llama.cpp portableGGUF con una cuantización documentadaCompatibilidad de la arquitectura, chat template, comportamiento del contexto, receta de cuantización y revisión del código fuente.
Inferencia en GPU con cuantización calibrada de pesosAWQ o GPTQEl serving engine, la GPU, el número de bits, el group size, los kernels y la arquitectura del modelo.
Serving en GPU de centro de datos compatibleFP8Compatibilidad del hardware, implementación del runtime, modo de calibración y calidad end-to-end.
Training eficiente en parámetros con pesos congelados de 4 bitsNF4 mediante bitsandbytesCompute dtype, nested quantization, memoria del optimizador y artifact final fusionado o del adaptador.
Prototipo más sencillo con Transformersbitsandbytes de 8 o 4 bitsCompatibilidad del backend y si el flujo del prototipo coincide con el servidor de producción.

GGUF no especifica una única cuantización

Una extensión .gguf indica cómo se empaquetan los tensores y los metadatos, no la precisión de todos los tensores. Nombres como Q4_K_M identifican recetas de cuantización de llama.cpp, y esas recetas pueden tratar los grupos de tensores de forma diferente. Registra el checkpoint original, la revisión de la conversión, el comando de cuantización, la matriz de importancia si se ha utilizado y los hashes.

AWQ y GPTQ necesitan un serving path compatible

Los artifacts de AWQ y GPTQ suelen utilizar Safetensors junto con una configuración específica del método. Un modelo puede descargarse correctamente y, aun así, hacer fallback a un kernel lento o fallar con una arquitectura no compatible. Comprueba la matriz de compatibilidad actual de Transformers, vLLM o de la versión real del servidor antes de seleccionar el artifact.

FP8 y NF4 resuelven problemas distintos

FP8 resulta atractivo cuando el acelerador y el stack de serving lo implementan de forma eficiente. NF4 se asocia principalmente al training de adaptadores con un uso eficiente de la memoria mediante flujos de trabajo de estilo QLoRA. Ninguna de las dos etiquetas garantiza la misma calidad, velocidad o uso de memoria en todos los modelos y configuraciones de hardware.

Lista de comprobación de evaluación

  • compara el mismo checkpoint de origen y el mismo conjunto de prompts
  • incluye contextos largos y solicitudes concurrentes
  • mide la corrección del schema y de los tool calls junto con la perplexity
  • registra la memoria máxima del dispositivo y del host
  • verifica el tiempo hasta el primer token y el throughput de salida
  • examina slices de calidad poco frecuentes o de alto coste
  • conserva con el artifact la licencia, la revisión del código fuente, el converter, la receta y el hash

Lecturas recomendadas

Referencias