Modèles d’embedding et modèles génératifs : que produit chacun ?

Traduction automatique

Cet article a été traduit automatiquement depuis la version originale en anglais.

Un modèle d’embedding représente une entrée sous forme de vecteur pour la recherche par similarité ou d’autres tâches en aval. Un modèle génératif produit une séquence, comme une réponse ou un structured output. Dans un système RAG, un modèle d’embedding aide à retrouver les éléments probants ; un générateur les utilise pour répondre.

Ces deux rôles peuvent utiliser des architectures apparentées, mais leurs objectifs d’entraînement et leurs sorties diffèrent.

Un vecteur est une représentation, pas une réponse

PropriétéModèle d’embeddingModèle génératif
Sortie habituelleVecteur de dimension fixeSéquence de tokens de longueur variable
Exemple de tâcheTrouver des passages similaires à une requêteExpliquer des passages ou en extraire des informations
ÉvaluationPertinence et classement des résultats de rechercheExactitude de la réponse et utilisation des éléments probants

Les modèles d’embedding de texte peuvent agréger les représentations des tokens issues d’un encodeur ou d’une architecture dérivée d’un décodeur. L’agrégation et l’entraînement des représentations rendent le vecteur utile ; calculer la moyenne d’états cachés arbitraires ne démontre pas la qualité de la recherche.

Par exemple, Qwen3-Embedding-8B est un modèle d’embedding de texte avec des dimensions de sortie configurables et des instructions propres à la tâche. Suivez les conventions du modèle pour les requêtes et les documents. Des représentations compatibles n’exigent pas forcément des préfixes d’entrée identiques.

Préserver la compatibilité de l’index

Enregistrez l’identité de l’encodeur, la dimension et le prétraitement utilisés pour indexer les documents. Les requêtes doivent utiliser l’encodeur de requêtes correspondant et ses instructions. Les vecteurs provenant de versions de modèles sans lien entre elles ne doivent généralement pas être inclus dans une même comparaison de similarité, même si leurs dimensions correspondent.

Changer le générateur peut laisser l’index vectoriel utilisable. Changer le modèle d’embedding nécessite généralement de recalculer les embeddings des documents ou de réaliser une autre migration explicitement testée.

Certains modèles permettent de raccourcir les vecteurs grâce à l’entraînement Matryoshka. L’annonce d’OpenAI sur les embeddings indique qu’une représentation de text-embedding-3-large à 256 dimensions a dépassé sur MTEB la représentation d’ada-002 à 1,536 dimensions utilisée pour la comparaison. Il s’agit d’un benchmark propre à ce modèle, pas d’une preuve qu’un nombre réduit de dimensions préserve toujours la qualité.

Pour votre corpus, testez la recherche avec des requêtes annotées aux dimensions prises en charge. Enregistrez le rappel des documents pertinents, le classement, le stockage et la latence de recherche. Un générateur de réponses plus performant ne peut pas retrouver de manière fiable un passage source que l’étape de recherche n’a jamais fourni.

La section sur les modèles d’embedding du guide d’ingénierie des LLM compare des exemples de modèles et explique la troncature des dimensions.