Embedding Models und generative Models: Was geben sie jeweils aus?

Automatische Übersetzung

Dieser Artikel wurde automatisch aus der englischen Originalversion übersetzt.

Ein Embedding Model stellt eine Eingabe als Vektor für die Ähnlichkeitssuche oder andere nachgelagerte Aufgaben dar. Ein generatives Model erzeugt eine Sequenz, etwa eine Antwort oder Structured Output. Bei RAG hilft ein Embedding Model, Belege abzurufen; ein Generator nutzt diese Belege für seine Antwort.

Beide Rollen können verwandte Architekturen verwenden, unterscheiden sich aber in ihren Trainingszielen und Ausgaben.

Ein Vektor ist eine Repräsentation, keine Antwort

EigenschaftEmbedding ModelGeneratives Model
Typische AusgabeVektor mit fester DimensionToken-Sequenz variabler Länge
BeispielaufgabePassagen finden, die einer Suchanfrage ähnelnPassagen erklären oder Informationen daraus extrahieren
BewertungRetrieval-Relevanz und RangfolgeKorrektheit der Antwort und Verwendung von Belegen

Text-Embedding Models können Token-Repräsentationen aus einem Encoder oder einer von einem Decoder abgeleiteten Architektur zusammenfassen. Dieses Pooling und das Training der Repräsentationen machen den Vektor nützlich; das Mitteln beliebiger verborgener Zustände belegt keine Retrieval-Qualität.

Zum Beispiel ist Qwen3-Embedding-8B ein Text-Embedding Model mit konfigurierbaren Ausgabedimensionen und Aufgabenanweisungen. Beachte die Vorgaben des Models für Suchanfragen und Dokumente. Kompatible Repräsentationen müssen keine identischen Eingabepräfixe verwenden.

Den Index kompatibel halten

Speichere die Identität des Encoders, die Dimension und die Vorverarbeitung, die zur Indexierung der Dokumente verwendet wurden. Suchanfragen müssen den zugehörigen Query-Encoder und dessen Anweisungen verwenden. Vektoren aus nicht zusammengehörenden Model-Versionen sollten grundsätzlich nicht in einem Ähnlichkeitsvergleich verwendet werden, auch wenn ihre Dimensionen übereinstimmen.

Ein Wechsel des Generators kann den Vektorindex weiterhin nutzbar lassen. Ein Wechsel des Embedding Models erfordert meist, die Dokumente erneut einzubetten oder eine andere ausdrücklich getestete Migration durchzuführen.

Einige Models unterstützen durch Matryoshka-Training verkürzte Vektoren. OpenAIs Ankündigung zu Embeddings berichtet, dass eine 256-dimensionale Repräsentation von text-embedding-3-large auf MTEB die zum Vergleich verwendete 1,536-dimensionale Repräsentation von ada-002 übertraf. Das ist ein modelspezifischer Benchmark und kein Beweis dafür, dass weniger Dimensionen die Qualität immer erhalten.

Teste für deinen Korpus das Retrieval mit annotierten Suchanfragen bei unterstützten Dimensionen. Erfasse den Recall relevanter Dokumente, die Rangfolge, den Speicherbedarf und die Such-Latency. Ein leistungsfähigerer Antwortgenerator kann eine Quellpassage, die das Retrieval nie geliefert hat, nicht zuverlässig wiederherstellen.

Der Abschnitt zu Embedding Models im LLM Engineering Guide vergleicht beispielhafte Models und erklärt das Kürzen von Vektordimensionen.