Эмбеддинг-модели и генеративные модели: что выдаёт каждая?
Автоматический перевод
Эта статья была автоматически переведена с оригинальной английской версии.
Эмбеддинг-модель представляет входные данные в виде вектора для поиска по сходству или других последующих задач. Генеративная модель создаёт последовательность, например ответ или structured output. В RAG эмбеддинг-модель помогает найти подтверждающие материалы, а генератор использует их для ответа.
Для этих ролей можно использовать родственные архитектуры, но цели обучения и выходные данные у них различаются.
Вектор — это представление, а не ответ
| Свойство | Эмбеддинг-модель | Генеративная модель |
|---|---|---|
| Типичный результат | Вектор фиксированной размерности | Последовательность токенов переменной длины |
| Пример задачи | Найти фрагменты, похожие на запрос | Объяснить фрагменты или извлечь из них информацию |
| Оценка | Релевантность retrieval и ранжирование | Правильность ответа и использование подтверждающих материалов |
Текстовые эмбеддинг-модели могут агрегировать представления токенов из энкодера или архитектуры на основе декодера. Агрегация и обучение представлений делают вектор полезным; усреднение произвольных скрытых состояний не подтверждает качество retrieval.
Например, Qwen3-Embedding-8B — это текстовая эмбеддинг-модель с настраиваемой размерностью выходных данных и инструкциями для задач. Следуйте правилам модели для запросов и документов. Совместимые представления не обязательно должны использовать одинаковые префиксы входных данных.
Сохраняйте совместимость индекса
Сохраняйте идентификатор энкодера, размерность и предобработку, использованные при индексации документов. Для запросов нужно использовать соответствующий энкодер запросов и инструкции. Векторы из не связанных друг с другом версий моделей обычно нельзя включать в одно сравнение сходства, даже если их размерности совпадают.
При смене генератора векторный индекс может остаться пригодным для использования. Смена эмбеддинг-модели обычно требует пересчёта эмбеддингов документов или другой явно протестированной миграции.
Некоторые модели поддерживают укороченные векторы благодаря обучению Matryoshka. В анонсе OpenAI об эмбеддингах сообщается, что 256-мерное представление text-embedding-3-large превзошло на MTEB сравниваемое с ним 1,536-мерное представление ada-002. Это бенчмарк конкретной модели, а не доказательство того, что уменьшение размерности всегда сохраняет качество.
Для своего корпуса протестируйте retrieval на размеченных запросах при поддерживаемых размерностях. Фиксируйте полноту поиска релевантных документов, ранжирование, объём хранения и латентность поиска. Более сильный генератор ответов не может надёжно восстановить фрагмент источника, который этап retrieval не предоставил.
Раздел об эмбеддинг-моделях в руководстве по LLM-инжинирингу сравнивает примеры моделей и объясняет усечение размерности.