Pipeline RAG en production : quelles étapes évaluer ?
Traduction automatique
Cet article a été traduit automatiquement depuis la version originale en anglais.
Évaluez séparément la préparation des documents, la recherche d’éléments probants et la génération des réponses. Un pipeline RAG en production doit conserver le contenu exploitable des sources, récupérer des éléments autorisés et produire une réponse étayée par ces éléments. La réponse finale seule ne permet pas d’identifier l’étape qui a échoué.
Commencez par une question dont le passage correct dans la source est connu.
Vérifiez les éléments probants avant de changer de modèle
| Étape | Éléments à conserver | Vérification |
|---|---|---|
| Analyse et découpage | Révision de la source, page ou section, identité du fragment | Les textes et tableaux nécessaires sont conservés pendant la préparation |
| Embeddings et indexation | Identité de l’encodeur, dimensions, métadonnées, autorisations | Les requêtes utilisent des représentations compatibles et des filtres d’accès |
| Recherche | Identités des candidats, scores, filtres appliqués | Les éléments autorisés attendus sont présents |
| Reranking et assemblage | Candidats conservés et écartés, entrée réelle du modèle | Les faits pertinents sont conservés avec suffisamment de contexte autour |
| Génération | Réponse et sources citées | Chaque affirmation importante est étayée |
Prenez une question portant sur une exclusion de garantie dans un PDF. Si l’analyse a omis le tableau des exclusions, changer le générateur ne le rétablira pas. Si le bon fragment a été récupéré puis écarté pendant le reranking, corrigez la sélection des candidats. S’il a atteint le prompt mais que la réponse le contredit, examinez l’utilisation des éléments probants et la génération.
Ajoutez des étapes de recherche pour les échecs mesurés
La recherche dense aide à traiter les paraphrases. La recherche parcimonieuse aide à retrouver des termes et identifiants exacts. La documentation des requêtes hybrides de Qdrant décrit la combinaison de résultats de recherche avec des méthodes comme la fusion réciproque des rangs. Déterminer si la recherche hybride améliore votre tâche nécessite toujours des annotations de pertinence.
Le reranking peut améliorer l’ordre des candidats, mais ajoute des calculs. Testez-le sur les candidats récupérés en tenant compte de la latence. Examinez aussi la position des passages pertinents dans le contexte du générateur : Lost in the Middle a observé des performances dépendant de la position dans les tâches à contexte long étudiées.
Appliquez les autorisations avant que du contenu non autorisé n’atteigne le modèle et conservez l’identité des sources jusqu’à la vérification des citations. Testez les mises à jour et les suppressions ainsi que l’ingestion de nouveaux contenus.
Pour choisir entre une recherche simple, agentic ou fondée sur des graphes, consultez Architecture RAG. La section sur le pipeline en production du Guide d’ingénierie LLM explique les relations entre les étapes.