Pipeline RAG en production : quelles étapes évaluer ?

Traduction automatique

Cet article a été traduit automatiquement depuis la version originale en anglais.

Évaluez séparément la préparation des documents, la recherche d’éléments probants et la génération des réponses. Un pipeline RAG en production doit conserver le contenu exploitable des sources, récupérer des éléments autorisés et produire une réponse étayée par ces éléments. La réponse finale seule ne permet pas d’identifier l’étape qui a échoué.

Commencez par une question dont le passage correct dans la source est connu.

Vérifiez les éléments probants avant de changer de modèle

ÉtapeÉléments à conserverVérification
Analyse et découpageRévision de la source, page ou section, identité du fragmentLes textes et tableaux nécessaires sont conservés pendant la préparation
Embeddings et indexationIdentité de l’encodeur, dimensions, métadonnées, autorisationsLes requêtes utilisent des représentations compatibles et des filtres d’accès
RechercheIdentités des candidats, scores, filtres appliquésLes éléments autorisés attendus sont présents
Reranking et assemblageCandidats conservés et écartés, entrée réelle du modèleLes faits pertinents sont conservés avec suffisamment de contexte autour
GénérationRéponse et sources citéesChaque affirmation importante est étayée

Prenez une question portant sur une exclusion de garantie dans un PDF. Si l’analyse a omis le tableau des exclusions, changer le générateur ne le rétablira pas. Si le bon fragment a été récupéré puis écarté pendant le reranking, corrigez la sélection des candidats. S’il a atteint le prompt mais que la réponse le contredit, examinez l’utilisation des éléments probants et la génération.

Ajoutez des étapes de recherche pour les échecs mesurés

La recherche dense aide à traiter les paraphrases. La recherche parcimonieuse aide à retrouver des termes et identifiants exacts. La documentation des requêtes hybrides de Qdrant décrit la combinaison de résultats de recherche avec des méthodes comme la fusion réciproque des rangs. Déterminer si la recherche hybride améliore votre tâche nécessite toujours des annotations de pertinence.

Le reranking peut améliorer l’ordre des candidats, mais ajoute des calculs. Testez-le sur les candidats récupérés en tenant compte de la latence. Examinez aussi la position des passages pertinents dans le contexte du générateur : Lost in the Middle a observé des performances dépendant de la position dans les tâches à contexte long étudiées.

Appliquez les autorisations avant que du contenu non autorisé n’atteigne le modèle et conservez l’identité des sources jusqu’à la vérification des citations. Testez les mises à jour et les suppressions ainsi que l’ingestion de nouveaux contenus.

Pour choisir entre une recherche simple, agentic ou fondée sur des graphes, consultez Architecture RAG. La section sur le pipeline en production du Guide d’ingénierie LLM explique les relations entre les étapes.