Эмбеддинг-модели и генеративные модели: что выдаёт каждая?

Автоматический перевод

Эта статья была автоматически переведена с оригинальной английской версии.

Эмбеддинг-модель представляет входные данные в виде вектора для поиска по сходству или других последующих задач. Генеративная модель создаёт последовательность, например ответ или structured output. В RAG эмбеддинг-модель помогает найти подтверждающие материалы, а генератор использует их для ответа.

Для этих ролей можно использовать родственные архитектуры, но цели обучения и выходные данные у них различаются.

Вектор — это представление, а не ответ

СвойствоЭмбеддинг-модельГенеративная модель
Типичный результатВектор фиксированной размерностиПоследовательность токенов переменной длины
Пример задачиНайти фрагменты, похожие на запросОбъяснить фрагменты или извлечь из них информацию
ОценкаРелевантность retrieval и ранжированиеПравильность ответа и использование подтверждающих материалов

Текстовые эмбеддинг-модели могут агрегировать представления токенов из энкодера или архитектуры на основе декодера. Агрегация и обучение представлений делают вектор полезным; усреднение произвольных скрытых состояний не подтверждает качество retrieval.

Например, Qwen3-Embedding-8B — это текстовая эмбеддинг-модель с настраиваемой размерностью выходных данных и инструкциями для задач. Следуйте правилам модели для запросов и документов. Совместимые представления не обязательно должны использовать одинаковые префиксы входных данных.

Сохраняйте совместимость индекса

Сохраняйте идентификатор энкодера, размерность и предобработку, использованные при индексации документов. Для запросов нужно использовать соответствующий энкодер запросов и инструкции. Векторы из не связанных друг с другом версий моделей обычно нельзя включать в одно сравнение сходства, даже если их размерности совпадают.

При смене генератора векторный индекс может остаться пригодным для использования. Смена эмбеддинг-модели обычно требует пересчёта эмбеддингов документов или другой явно протестированной миграции.

Некоторые модели поддерживают укороченные векторы благодаря обучению Matryoshka. В анонсе OpenAI об эмбеддингах сообщается, что 256-мерное представление text-embedding-3-large превзошло на MTEB сравниваемое с ним 1,536-мерное представление ada-002. Это бенчмарк конкретной модели, а не доказательство того, что уменьшение размерности всегда сохраняет качество.

Для своего корпуса протестируйте retrieval на размеченных запросах при поддерживаемых размерностях. Фиксируйте полноту поиска релевантных документов, ранжирование, объём хранения и латентность поиска. Более сильный генератор ответов не может надёжно восстановить фрагмент источника, который этап retrieval не предоставил.

Раздел об эмбеддинг-моделях в руководстве по LLM-инжинирингу сравнивает примеры моделей и объясняет усечение размерности.