Modele embedding i modele generatywne: co zwraca każdy z nich?
Tłumaczenie automatyczne
Ten artykuł został automatycznie przetłumaczony z angielskiego oryginału.
Model embedding przedstawia dane wejściowe jako wektor do wyszukiwania podobieństwa lub innych dalszych zadań. Model generatywny tworzy sekwencję, na przykład odpowiedź lub ustrukturyzowane dane wyjściowe. W RAG model embedding pomaga wyszukać materiały źródłowe, a generator wykorzystuje je do udzielenia odpowiedzi.
Obie role mogą korzystać z pokrewnych architektur, ale różnią się celami treningu i danymi wyjściowymi.
Wektor jest reprezentacją, a nie odpowiedzią
| Właściwość | Model embedding | Model generatywny |
|---|---|---|
| Typowe dane wyjściowe | Wektor o stałej liczbie wymiarów | Sekwencja tokenów o zmiennej długości |
| Przykładowe zadanie | Znajdowanie fragmentów podobnych do zapytania | Wyjaśnianie fragmentów lub wydobywanie z nich informacji |
| Ewaluacja | Trafność i ranking wyników wyszukiwania | Poprawność odpowiedzi i wykorzystanie materiałów źródłowych |
Modele embedding tekstu mogą agregować reprezentacje tokenów z enkodera lub architektury wywodzącej się z dekodera. Agregacja i trening reprezentacji sprawiają, że wektor jest użyteczny; uśrednianie dowolnych stanów ukrytych nie potwierdza jakości wyszukiwania.
Na przykład Qwen3-Embedding-8B to model embedding tekstu z konfigurowalną liczbą wymiarów wyjściowych i instrukcjami zadania. Stosuj konwencje modelu dotyczące zapytań i dokumentów. Zgodne reprezentacje nie muszą używać identycznych prefiksów wejściowych.
Zachowaj zgodność indeksu
Zapisuj tożsamość enkodera, liczbę wymiarów i sposób przetwarzania wstępnego użyty do indeksowania dokumentów. Zapytania muszą korzystać z odpowiedniego enkodera zapytań i jego instrukcji. Wektory z niepowiązanych wersji modeli na ogół nie powinny uczestniczyć w tym samym porównaniu podobieństwa, nawet jeśli mają tyle samo wymiarów.
Zmiana generatora może pozostawić indeks wektorowy zdatny do użycia. Zmiana modelu embedding zwykle wymaga ponownego obliczenia embeddingów dokumentów lub innej jawnie przetestowanej migracji.
Niektóre modele obsługują skrócone wektory dzięki treningowi Matryoshka. Ogłoszenie OpenAI dotyczące embeddingów podaje, że 256-wymiarowa reprezentacja text-embedding-3-large przewyższyła w MTEB porównywaną 1,536-wymiarową reprezentację ada-002. To benchmark konkretnego modelu, a nie dowód, że mniejsza liczba wymiarów zawsze zachowuje jakość.
Dla swojego korpusu testuj wyszukiwanie przy obsługiwanych liczbach wymiarów, używając zapytań z oznaczonymi wynikami. Rejestruj pełność wyszukiwania istotnych dokumentów, ranking, zużycie pamięci i opóźnienie wyszukiwania. Silniejszy generator odpowiedzi nie potrafi niezawodnie odtworzyć fragmentu źródłowego, którego etap wyszukiwania nigdy nie dostarczył.
Sekcja o modelach embedding w przewodniku po inżynierii LLM porównuje przykładowe modele i wyjaśnia obcinanie wymiarów.