Potok RAG w produkcji: które etapy należy oceniać?

Tłumaczenie automatyczne

Ten artykuł został automatycznie przetłumaczony z angielskiego oryginału.

Oceniaj osobno przygotowanie dokumentów, wyszukiwanie materiału źródłowego i generowanie odpowiedzi. Potok RAG w produkcji musi zachować użyteczną treść źródeł, wyszukiwać materiał zgodny z uprawnieniami i tworzyć odpowiedź popartą tym materiałem. Sama końcowa odpowiedź nie pozwala ustalić, który etap zawiódł.

Zacznij od pytania, dla którego znasz właściwy fragment źródła.

Sprawdź materiał źródłowy, zanim zmienisz model

EtapCo zachowaćCo sprawdzić
Parsowanie i podział na fragmentyWersja źródła, strona lub sekcja, tożsamość fragmentuPotrzebne teksty i tabele zostają zachowane podczas przygotowania
Embeddingi i indeksowanieTożsamość enkodera, wymiary, metadane, uprawnieniaZapytania używają zgodnych reprezentacji i filtrów dostępu
WyszukiwanieTożsamości kandydatów, wyniki punktowe, zastosowane filtryOczekiwany materiał zgodny z uprawnieniami jest obecny
Reranking i zestawianieZachowani i odrzuceni kandydaci, faktyczne dane wejściowe modeluIstotne fakty zostają zachowane wraz z wystarczającym kontekstem
GenerowanieOdpowiedź i cytowane źródłaKażde istotne twierdzenie ma oparcie w źródłach

Rozważ pytanie o wyłączenie z gwarancji opisane w pliku PDF. Jeśli parsowanie pominęło tabelę wyłączeń, zmiana generatora jej nie przywróci. Jeśli właściwy fragment został wyszukany, ale usunięty podczas rerankingu, popraw wybór kandydatów. Jeśli trafił do promptu, ale odpowiedź mu przeczy, zbadaj wykorzystanie materiału źródłowego i generowanie.

Dodawaj etapy wyszukiwania w odpowiedzi na zmierzone błędy

Wyszukiwanie gęste pomaga w przypadku parafraz. Wyszukiwanie rzadkie pomaga w przypadku dokładnych terminów i identyfikatorów. Dokumentacja zapytań hybrydowych Qdrant opisuje łączenie wyników wyszukiwania metodami takimi jak reciprocal rank fusion. Ustalenie, czy wyszukiwanie hybrydowe poprawia wyniki w twoim zadaniu, nadal wymaga etykiet trafności.

Reranking może poprawić kolejność kandydatów, ale wymaga dodatkowych obliczeń. Testuj go na wyszukanych kandydatach, uwzględniając opóźnienie. Sprawdź też, gdzie istotne fragmenty znajdują się w kontekście generatora: badanie Lost in the Middle wykazało zależność wyników od pozycji w badanych zadaniach z długim kontekstem.

Egzekwuj uprawnienia, zanim niedozwolona treść źródłowa trafi do modelu, i zachowuj tożsamość źródła aż do sprawdzania cytowań. Testuj aktualizacje i usuwanie danych, a także wczytywanie nowych danych.

Wybór między wyszukiwaniem prostym, agentowym i opartym na grafach opisuje Architektura RAG. Sekcja o potoku produkcyjnym w przewodniku po inżynierii LLM wyjaśnia zależności między etapami.