RAG-Pipeline im Produktivbetrieb: Welche Stufen sollte ich evaluieren?
Automatische Übersetzung
Dieser Artikel wurde automatisch aus der englischen Originalversion übersetzt.
Evaluiere Dokumentaufbereitung, Retrieval von Belegen und Antwortgenerierung getrennt. Eine RAG-Pipeline im Produktivbetrieb muss nutzbare Quellinhalte erhalten, zulässige Belege abrufen und eine Antwort erzeugen, die durch diese Belege gestützt wird. Die endgültige Antwort allein zeigt nicht, welche Stufe fehlgeschlagen ist.
Beginne mit einer Frage, deren korrekte Quellpassage bekannt ist.
Prüfe die Belege, bevor du das Model wechselst
| Stufe | Was aufbewahrt werden sollte | Prüfung |
|---|---|---|
| Parsen und Chunking | Quellversion, Seite oder Abschnitt, Chunk-ID | Benötigte Texte und Tabellen bleiben bei der Aufbereitung erhalten |
| Embeddings und Indexierung | Encoder-ID, Dimensionen, Metadaten, Berechtigungen | Abfragen verwenden kompatible Repräsentationen und Zugriffsfilter |
| Retrieval | Kandidaten-IDs, Scores, angewendete Filter | Die erwarteten zulässigen Belege sind vorhanden |
| Reranking und Zusammenstellung | Behaltene und entfernte Kandidaten, tatsächliche Eingabe des Models | Relevante Fakten bleiben mit ausreichend umgebendem Kontext erhalten |
| Generierung | Antwort und zitierte Quellen | Jede wesentliche Aussage ist belegt |
Betrachte eine Frage zu einem Garantieausschluss in einer PDF-Datei. Wenn beim Parsen die Tabelle mit den Ausschlüssen ausgelassen wurde, stellt ein Wechsel des Generators sie nicht wieder her. Wenn der richtige Chunk abgerufen, aber beim Reranking entfernt wurde, korrigiere die Kandidatenauswahl. Wenn er den Prompt erreicht hat, die Antwort ihm aber widerspricht, untersuche die Nutzung der Belege und die Generierung.
Ergänze Retrieval-Stufen für gemessene Fehler
Dense Retrieval hilft bei Paraphrasen. Sparse Retrieval hilft bei exakten Begriffen und Kennungen. Die Dokumentation zu hybriden Abfragen von Qdrant beschreibt die Kombination von Retrieval-Ergebnissen mit Verfahren wie Reciprocal Rank Fusion. Ob hybrides Retrieval deine Aufgabe verbessert, muss weiterhin anhand von Relevanzlabels geprüft werden.
Reranking kann die Reihenfolge der Kandidaten verbessern, erfordert aber zusätzliche Berechnungen. Teste es mit den abgerufenen Kandidaten und berücksichtige dabei die Latency. Prüfe außerdem, an welcher Stelle im Kontext des Generators relevante Passagen stehen: Lost in the Middle stellte bei den untersuchten Aufgaben mit langem Kontext eine positionsabhängige Leistung fest.
Wende Berechtigungsfilter an, bevor unzulässige Quellinhalte das Model erreichen, und erhalte die Quell-ID bis zur Prüfung der Zitate. Teste neben der Ingestion neuer Inhalte auch Aktualisierungen und Löschungen.
Zur Wahl zwischen einfachem, agentic oder graphbasiertem Retrieval siehe RAG-Architektur. Der Abschnitt zur Produktions-Pipeline im LLM Engineering Guide erklärt die Beziehungen zwischen den Stufen.