Pipeline RAG en producción: ¿qué etapas debo evaluar?

Traducción automática

Este artículo se tradujo automáticamente a partir de la versión original en inglés.

Evalúa por separado la preparación de documentos, la recuperación de evidencias y la generación de respuestas. Un pipeline RAG en producción debe conservar contenido útil de las fuentes, recuperar evidencias permitidas y producir una respuesta respaldada por esas evidencias. La respuesta final por sí sola no permite identificar qué etapa ha fallado.

Empieza con una pregunta cuyo pasaje correcto en la fuente sea conocido.

Comprueba las evidencias antes de cambiar el modelo

EtapaQué conservarComprobación
Análisis y división en fragmentosRevisión de la fuente, página o sección, identidad del fragmentoEl texto y las tablas necesarios se conservan durante la preparación
Embeddings e indexaciónIdentidad del codificador, dimensiones, metadatos, permisosLas consultas usan representaciones compatibles y filtros de acceso
RecuperaciónIdentidades de los candidatos, puntuaciones, filtros aplicadosLas evidencias permitidas que se esperan están presentes
Reranking y preparaciónCandidatos conservados y descartados, entrada real del modeloLos hechos relevantes se conservan con suficiente contexto alrededor
GeneraciónRespuesta y fuentes citadasCada afirmación importante tiene respaldo

Considera una pregunta sobre una exclusión de garantía en un PDF. Si el análisis omitió la tabla de exclusiones, cambiar el generador no la recuperará. Si se recuperó el fragmento correcto pero se descartó durante el reranking, corrige la selección de candidatos. Si llegó al prompt pero la respuesta lo contradice, investiga el uso de las evidencias y la generación.

Añade etapas de recuperación para los fallos medidos

La recuperación densa ayuda con las paráfrasis. La recuperación dispersa ayuda con términos e identificadores exactos. La documentación de consultas híbridas de Qdrant describe cómo combinar resultados de recuperación mediante métodos como la fusión de rangos recíprocos. Determinar si la recuperación híbrida mejora tu tarea sigue requiriendo etiquetas de relevancia.

El reranking puede mejorar el orden de los candidatos, pero añade cómputo. Pruébalo con los candidatos recuperados e incluye la latencia. Inspecciona también dónde aparecen los pasajes relevantes en el contexto del generador: Lost in the Middle observó un rendimiento dependiente de la posición en las tareas de contexto largo que evaluó.

Aplica los permisos antes de que el contenido de fuentes no autorizado llegue al modelo y conserva la identidad de la fuente hasta la comprobación de citas. Prueba las actualizaciones y eliminaciones, además de la ingesta de contenido nuevo.

Para elegir entre recuperación básica, agentic o basada en grafos, consulta Arquitectura RAG. La sección sobre el pipeline en producción de la Guía de ingeniería de LLM explica las relaciones entre las etapas.