RAG-пайплайн в продакшене: какие этапы оценивать?

Автоматический перевод

Эта статья была автоматически переведена с оригинальной английской версии.

Оценивайте подготовку документов, retrieval исходных материалов и генерацию ответов отдельно. RAG-пайплайн в продакшене должен сохранять пригодное содержимое источников, извлекать материалы с учётом прав доступа и формировать ответ, подтверждённый этими материалами. По одному итоговому ответу нельзя определить, на каком этапе произошёл сбой.

Начните с вопроса, для которого известен правильный фрагмент источника.

Проверьте исходные материалы, прежде чем менять модель

ЭтапЧто сохранятьЧто проверять
Парсинг и чанкингВерсию источника, страницу или раздел, идентификатор чанкаНужные тексты и таблицы сохраняются при подготовке
Эмбеддинги и индексацияИдентификатор энкодера, размерность, метаданные, права доступаЗапросы используют совместимые представления и фильтры доступа
RetrievalИдентификаторы кандидатов, оценки, применённые фильтрыОжидаемые материалы, разрешённые правами доступа, присутствуют
Реранкинг и сборкаСохранённых и удалённых кандидатов, фактический ввод моделиНужные факты сохраняются с достаточным окружающим контекстом
ГенерацияОтвет и цитируемые источникиКаждое значимое утверждение подтверждено

Рассмотрим вопрос об исключении из гарантии в PDF. Если парсинг пропустил таблицу исключений, смена генератора её не восстановит. Если правильный чанк был найден, но удалён при реранкинге, исправьте отбор кандидатов. Если он попал в промпт, но ответ ему противоречит, исследуйте использование исходных материалов и генерацию.

Добавляйте этапы retrieval для измеренных ошибок

Плотный retrieval помогает находить перефразированные формулировки. Разреженный retrieval помогает искать точные термины и идентификаторы. Документация Qdrant по гибридным запросам описывает объединение результатов retrieval такими методами, как reciprocal rank fusion. Чтобы определить, улучшает ли гибридный retrieval результаты вашей задачи, по-прежнему нужны метки релевантности.

Реранкинг может улучшить порядок кандидатов, но требует дополнительных вычислений. Проверяйте его на найденных кандидатах с учётом латентности. Также проверьте, где расположены нужные фрагменты в контексте генератора: исследование Lost in the Middle обнаружило зависимость качества от позиции в исследованных задачах с длинным контекстом.

Применяйте ограничения доступа до того, как запрещённое содержимое источников попадёт в модель, и сохраняйте идентификатор источника до проверки цитат. Проверяйте обновления и удаления, а также загрузку новых данных.

О выборе между простым, агентным и графовым retrieval читайте в статье Архитектура RAG. Раздел о пайплайне в продакшене в руководстве по LLM-инжинирингу объясняет связи между этапами.