RAG-pipeline in productie: welke stappen moet ik evalueren?
Automatische vertaling
Dit artikel is automatisch vertaald vanuit de oorspronkelijke Engelse versie.
Evalueer documentvoorbereiding, retrieval van bronmateriaal en antwoordgeneratie afzonderlijk. Een RAG-pipeline in productie moet bruikbare broninhoud behouden, toegestaan bronmateriaal ophalen en een antwoord geven dat door dat materiaal wordt ondersteund. Alleen het uiteindelijke antwoord laat niet zien welke stap is mislukt.
Begin met een vraag waarvan de juiste bronpassage bekend is.
Controleer het bronmateriaal voordat je het model verandert
| Stap | Wat je moet bewaren | Controle |
|---|---|---|
| Parseren en chunking | Bronversie, pagina of sectie, chunk-identiteit | De benodigde tekst en tabellen blijven bij de voorbereiding behouden |
| Embeddings en indexering | Encoder-identiteit, dimensies, metadata, toegangsrechten | Zoekopdrachten gebruiken compatibele representaties en toegangsfilters |
| Retrieval | Kandidaatidentiteiten, scores, toegepaste filters | Het verwachte toegestane bronmateriaal is aanwezig |
| Reranking en samenstellen | Behouden en verwijderde kandidaten, daadwerkelijke modelinvoer | Relevante feiten blijven behouden met voldoende omliggende context |
| Generatie | Antwoord en aangehaalde bronnen | Elke belangrijke bewering wordt ondersteund |
Neem een vraag over een garantie-uitsluiting in een PDF. Als de parser de tabel met uitsluitingen heeft overgeslagen, brengt een andere generator die niet terug. Als de juiste chunk is opgehaald maar tijdens reranking is verwijderd, verbeter dan de kandidaatselectie. Als de chunk de prompt heeft bereikt maar het antwoord ermee in tegenspraak is, onderzoek dan het gebruik van bronmateriaal en de generatie.
Voeg retrieval-stappen toe voor gemeten fouten
Dense retrieval helpt bij parafrases. Sparse retrieval helpt bij exacte termen en identificatoren. De documentatie over hybride zoekopdrachten van Qdrant beschrijft hoe je retrieval-resultaten combineert met methoden zoals reciprocal rank fusion. Om te bepalen of hybride retrieval jouw taak verbetert, blijven relevantielabels nodig.
Reranking kan de volgorde van kandidaten verbeteren, maar vraagt extra rekenwerk. Test dit op de opgehaalde kandidaten en neem latency mee. Onderzoek ook waar relevante passages in de context van de generator staan: Lost in the Middle vond positieafhankelijke prestaties bij de onderzochte taken met lange context.
Pas toegangsrechten toe voordat ongeautoriseerde broninhoud het model bereikt en behoud de bronidentiteit tot aan de controle van bronverwijzingen. Test ook updates en verwijderingen, naast de inname van nieuwe inhoud.
Zie RAG-architectuur voor de keuze tussen eenvoudige, agentic of graafgebaseerde retrieval. De sectie over de pipeline in productie in de LLM Engineering Guide legt de relaties tussen de stappen uit.