Embedding models en generatieve models: wat levert elk op?
Automatische vertaling
Dit artikel is automatisch vertaald vanuit de oorspronkelijke Engelse versie.
Een embedding model stelt een invoer voor als een vector voor zoeken op gelijkenis of andere vervolgtaken. Een generatief model produceert een reeks, zoals een antwoord of structured output. Bij RAG helpt een embedding model om onderbouwing op te halen; een generator gebruikt die onderbouwing om te antwoorden.
Beide rollen kunnen verwante architecturen gebruiken, maar hun trainingsdoelen en uitvoer verschillen.
Een vector is een representatie, geen antwoord
| Eigenschap | Embedding model | Generatief model |
|---|---|---|
| Gebruikelijke uitvoer | Vector met een vast aantal dimensies | Reeks tokens met variabele lengte |
| Voorbeeldtaak | Passages vinden die op een zoekvraag lijken | Passages uitleggen of er informatie uit halen |
| Beoordeling | Relevantie en rangschikking bij retrieval | Juistheid van het antwoord en gebruik van onderbouwing |
Tekst-embedding models kunnen representaties van tokens uit een encoder of een van een decoder afgeleide architectuur samenvoegen. Die samenvoeging en de training van de representaties maken de vector bruikbaar; het middelen van willekeurige verborgen toestanden toont geen retrieval-kwaliteit aan.
Qwen3-Embedding-8B is bijvoorbeeld een tekst-embedding model met instelbare uitvoerdimensies en taakinstructies. Volg de conventies van het model voor zoekvragen en documenten. Compatibele representaties hoeven geen identieke invoerprefixen te gebruiken.
Houd de index compatibel
Sla de identiteit van de encoder, het aantal dimensies en de voorbewerking op waarmee de documenten zijn geïndexeerd. Zoekvragen moeten de bijbehorende query-encoder en instructies gebruiken. Vectoren uit niet-verwante modelversies horen doorgaans niet in dezelfde gelijkenisvergelijking, ook als hun aantallen dimensies overeenkomen.
Als je de generator verandert, kan de vectorindex bruikbaar blijven. Als je het embedding model verandert, moet je doorgaans de embeddings van documenten opnieuw berekenen of een andere expliciet geteste migratie uitvoeren.
Sommige models ondersteunen verkorte vectoren via Matryoshka-training. Volgens OpenAI’s aankondiging over embeddings presteerde een representatie van text-embedding-3-large met 256 dimensies op MTEB beter dan de vergeleken representatie van ada-002 met 1,536 dimensies. Dit is een modelspecifieke benchmark, geen bewijs dat minder dimensies altijd de kwaliteit behouden.
Test voor je corpus retrieval met gelabelde zoekvragen bij ondersteunde aantallen dimensies. Leg de recall van relevante documenten, de rangschikking, de opslag en de latency van zoekopdrachten vast. Een sterkere antwoordgenerator kan een bronpassage die retrieval nooit heeft aangeleverd niet betrouwbaar achterhalen.
Het gedeelte over embedding models in de LLM Engineering Guide vergelijkt voorbeelden van models en legt uit hoe je dimensies afkapt.