RAG-пайплайн в продакшене: какие этапы оценивать?
Автоматический перевод
Эта статья была автоматически переведена с оригинальной английской версии.
Оценивайте подготовку документов, retrieval исходных материалов и генерацию ответов отдельно. RAG-пайплайн в продакшене должен сохранять пригодное содержимое источников, извлекать материалы с учётом прав доступа и формировать ответ, подтверждённый этими материалами. По одному итоговому ответу нельзя определить, на каком этапе произошёл сбой.
Начните с вопроса, для которого известен правильный фрагмент источника.
Проверьте исходные материалы, прежде чем менять модель
| Этап | Что сохранять | Что проверять |
|---|---|---|
| Парсинг и чанкинг | Версию источника, страницу или раздел, идентификатор чанка | Нужные тексты и таблицы сохраняются при подготовке |
| Эмбеддинги и индексация | Идентификатор энкодера, размерность, метаданные, права доступа | Запросы используют совместимые представления и фильтры доступа |
| Retrieval | Идентификаторы кандидатов, оценки, применённые фильтры | Ожидаемые материалы, разрешённые правами доступа, присутствуют |
| Реранкинг и сборка | Сохранённых и удалённых кандидатов, фактический ввод модели | Нужные факты сохраняются с достаточным окружающим контекстом |
| Генерация | Ответ и цитируемые источники | Каждое значимое утверждение подтверждено |
Рассмотрим вопрос об исключении из гарантии в PDF. Если парсинг пропустил таблицу исключений, смена генератора её не восстановит. Если правильный чанк был найден, но удалён при реранкинге, исправьте отбор кандидатов. Если он попал в промпт, но ответ ему противоречит, исследуйте использование исходных материалов и генерацию.
Добавляйте этапы retrieval для измеренных ошибок
Плотный retrieval помогает находить перефразированные формулировки. Разреженный retrieval помогает искать точные термины и идентификаторы. Документация Qdrant по гибридным запросам описывает объединение результатов retrieval такими методами, как reciprocal rank fusion. Чтобы определить, улучшает ли гибридный retrieval результаты вашей задачи, по-прежнему нужны метки релевантности.
Реранкинг может улучшить порядок кандидатов, но требует дополнительных вычислений. Проверяйте его на найденных кандидатах с учётом латентности. Также проверьте, где расположены нужные фрагменты в контексте генератора: исследование Lost in the Middle обнаружило зависимость качества от позиции в исследованных задачах с длинным контекстом.
Применяйте ограничения доступа до того, как запрещённое содержимое источников попадёт в модель, и сохраняйте идентификатор источника до проверки цитат. Проверяйте обновления и удаления, а также загрузку новых данных.
О выборе между простым, агентным и графовым retrieval читайте в статье Архитектура RAG. Раздел о пайплайне в продакшене в руководстве по LLM-инжинирингу объясняет связи между этапами.