Mejores modelos NER en 2026: spaCy, GLiNER, Transformers y LLMs

Traducción automática Este artículo se tradujo automáticamente a partir de la versión original en inglés.

El reconocimiento de entidades con nombre (NER) encuentra y etiqueta fragmentos de texto, como personas, empresas y códigos de producto. Esta página está dirigida a ingenieros que deben elegir un enfoque de extracción para una carga de trabajo de producción. Ofrece un punto de partida que puedes probar con tu schema, tus documentos y tus restricciones operativas.

Usa spaCy para etiquetas estables y pipelines rápidos. Elige GLiNER cuando las etiquetas cambien con frecuencia, un bi-encoder cuando un inventario grande de etiquetas pueda reutilizar embeddings almacenados en caché, o un clasificador de tokens basado en Transformer con fine-tuning cuando dispongas de ejemplos etiquetados. Usa extracción estructurada basada en LLM cuando necesites un registro complejo en lugar de una lista sencilla de fragmentos.

Última revisión: 17-08-2026. Criterios de selección: estabilidad de las etiquetas, inventario de etiquetas, salida en forma de fragmentos frente a registros, idioma, datos supervisados, latencia, normalización y coste de revisión.

Tabla de decisión

NecesidadMejor punto de partidaMotivo
NER rápido con etiquetas conocidasspaCyPipelines maduros, buena ergonomía, despliegue rápido en CPU e integración con reglas.
Etiquetas nuevas sin entrenamiento completoGLiNERLa extracción condicionada por etiquetas funciona bien cuando cambia el conjunto de etiquetas. Empieza con descripciones claras de los tipos, no con nombres aislados.
Inventario grande y reutilizable de etiquetasGLiNER bi-encoderPuede precalcular y almacenar en caché los embeddings de las etiquetas en lugar de codificarlas con cada documento.
Entidades y relaciones en una sola pasadaCandidato GLiNER-RelexExtrae conjuntamente los tipos de entidad y de relación. Compáralo con fases separadas usando el schema de relaciones objetivo.
Entidades además de campos documentales o clasificaciónGLiNER2Su interfaz de schema combina reconocimiento de entidades, clasificación y tareas de extracción estructurada.
Entidades anidadas o solapadasDecodificador compatible con anidamiento, incluido GLiNER con flat_ner=FalseLa decodificación plana suprime los solapamientos. Prueba los fragmentos anidados con anotaciones que contengan los patrones de solapamiento esperados.
Extracción multilingüe o en varios scriptsGLiNER-X o baseline XLM-RNingún modelo gana en todos los idiomas. Prueba cada idioma objetivo y la redacción de sus descripciones de tipos.
Etiquetas de dominio estables con fragmentos etiquetados representativosClasificador de tokens con fine-tuning o pipeline de spaCyEstablece un baseline supervisado y compara el exact-span F1, la latencia y el coste en tu conjunto de dominio.
Campos implícitos, entre frases o estructuradosCandidato basado en LLM o híbridoLos structured outputs limitan la forma de la respuesta, no la corrección de la extracción. Valida la precisión por campo en un conjunto de prueba del dominio.
PII sensible o flujo reguladoPresidio más candidato GLiNER2-PIICombina la salida del modelo con comprobaciones deterministas, controles de redacción y revisión.

Clases de herramientas

ClaseVentajaDesventajaAdecuado para
NER de spaCyRápido, adecuado para producción y consciente de reglasNecesita entrenamiento o reglas para etiquetas personalizadasEtiquetas conocidas en sistemas de alto rendimiento.
GLiNEREtiquetas flexibles en inferenciaLa calidad depende de la redacción de las etiquetas y del desajuste con el dominioIteración rápida de ontologías y etiquetas long-tail.
GLiNER bi-encoderLos embeddings de etiquetas almacenados en caché permiten escalar ontologías grandesLos beneficios dependen de la reutilización de etiquetas y de la forma de la carga de trabajoInventarios reutilizados de decenas a miles de etiquetas.
GLiNER2Extracción de schema multitareaCada tarea y el schema combinado aún requieren evaluaciónEntidades, clasificación y campos estructurados.
GLiNER-RelexExtracción conjunta de entidades y relacionesModelo más reciente que necesita comparación específica por tareaSchemas explícitos de entidad-relación.
Clasificador de tokens basado en TransformerAlta precisión supervisadaRequiere fragmentos etiquetados y reentrenamientoExtracción estable de dominio con suficientes datos.
Extracción con LLMFlexibilidad del schema y capacidad de razonamientoMayor latencia, coste y no determinismoRegistros complejos, valores implícitos y flujos de bajo volumen.
Reglas y diccionariosComportamiento determinista de matchingRecall frágilCumplimiento, identificadores, códigos de producto y post-filters.

Cómo elegir

Empieza por el schema de entidades, no por el modelo.

Si las etiquetas son estables y dispones de ejemplos representativos, aplica fine-tuning a un clasificador de tokens. Compáralo en un conjunto de dominio reservado para evaluación. Predice etiquetas de tokens sin generación autoregresiva. La latencia y el coste siguen dependiendo del modelo, el hardware, el tamaño del batch y el stack de serving.

Si las etiquetas cambian cada semana, usa GLiNER o un extractor basado en LLM mientras se estabiliza la ontología. Escribe una descripción breve del tipo para cada etiqueta ambigua. La investigación reciente sobre NER hard zero-shot muestra que las descripciones mejoran la generalización y evitan confundir la filtración de etiquetas con capacidad zero-shot. El objetivo es aprender cómo debe ser el schema antes de invertir presupuesto en anotación.

Si reutilizas un inventario grande de etiquetas, evalúa primero un bi-encoder antes que un encoder conjunto de etiquetas y texto. El artículo sobre GLiNER bi-encoder informa de un micro-F1 de 61,5 en CrossNER. También informa de hasta 130 veces más throughput con 1.024 etiquetas y embeddings precalculados bajo sus condiciones de prueba con H100. Estos resultados identifican un comportamiento de escalado. No estiman el rendimiento de otra carga de trabajo de producción.

Si los documentos abarcan varios idiomas, haz benchmark de cada idioma y script objetivo. OpenNER 1.0 no encontró un único modelo que fuese el mejor en toda su colección de 52 idiomas. Prueba tanto descripciones de tipos en inglés como localizadas, porque el texto de la etiqueta forma parte de la entrada del modelo.

Si la salida es un registro estructurado en lugar de fragmentos, usa un LLM con structured outputs o un pipeline híbrido. LangExtract resulta útil cuando cada extracción debe poder vincularse con su ubicación de origen. NuExtract es una opción self-hosted para la extracción multimodal de documentos. Ambos necesitan evaluación a nivel de campo en los documentos objetivo.

Muchas tareas de extracción empresarial no son NER puro. «Encuentra las partes, las obligaciones, la fecha de entrada en vigor, la cláusula de rescisión y la ley aplicable» es comprensión documental con campos de entidades.

Para PII, usa un framework de PII como Presidio como capa de integración y redacción. Trata GLiNER2-PII como candidato de modelo, no como una decisión de compliance. Mide el recall en los formatos sensibles, idiomas y documentos que procesará el sistema.

Pipeline de producción

Un pipeline de extracción de producción suele añadir fases alrededor del modelo:

  1. Extracción de candidatos: spaCy, GLiNER, modelo Transformer, LLM, reglas o una combinación.
  2. Normalización opcional o entity linking: asigna los fragmentos a IDs canónicos, códigos de producto, usuarios, empresas o entradas de la ontología.
  3. Validación y revisión: rechaza etiquetas imposibles, aplica las restricciones del schema, elimina fragmentos duplicados y deriva los casos inciertos a revisión.

La normalización convierte el texto extraído en datos de producto útiles. Encontrar el fragmento «Apple» es solo el primer paso. El sistema aún debe decidir si significa la empresa, la fruta, una familia de productos o un ticker bursátil, y después asignarle un ID estable.

Checklist de evaluación

Mide algo más que el F1 a nivel de entidad:

  • F1 de fragmentos exactos
  • F1 de fragmentos relajados
  • matriz de confusión de etiquetas
  • gestión de entidades anidadas
  • precisión de la normalización de entidades
  • sensibilidad a la descripción del tipo y al idioma de la etiqueta
  • segmentación por idioma, script y formato documental
  • falsos positivos por etiqueta
  • calibración de confianza
  • latencia y coste por documento
  • tasa de correcciones humanas

Mantén el conjunto de prueba separado del diseño del schema y del ajuste de umbrales. Informa del número de documentos y menciones de entidades por etiqueta. Usa intervalos de confianza a nivel de documento cuando las menciones repetidas en un mismo documento puedan inflar la certeza.

Lecturas recomendadas

Referencias