Modele z enkoderem i dekoderem: którą architekturę wybrać?
Tłumaczenie automatyczne
Ten artykuł został automatycznie przetłumaczony z angielskiego oryginału.
Użyj enkodera wytrenowanego do danego zadania, gdy potrzebujesz reprezentacji lub predykcji na podstawie wejścia. Użyj modelu enkoder–dekoder, gdy wytrenowany system przekształca jedną sekwencję w drugą. Użyj modelu językowego z samym dekoderem do generacji autoregresyjnej i zadań opartych na promptach. Trening i interfejs wyjściowy checkpointu mają takie samo znaczenie jak nazwa architektury.
To użyteczne opcje wyjściowe dla inżynierów wybierających modele, a nie ograniczenia tego, co może zrobić dostosowana architektura.
Porównaj, co zwraca każdy model
| Rodzina | Schemat uwagi | Typowe wyjście i przykład |
|---|---|---|
| Sam enkoder | Tokeny widzą całe wejście | Reprezentacje tokenów, etykiety lub fragmenty tekstu; BERT |
| Enkoder–dekoder | Enkoder obejmujący całe wejście; przyczynowy dekoder wyjściowy z uwagą krzyżową | Wygenerowana sekwencja wyjściowa; T5 |
| Sam dekoder | Uwaga przyczynowa w sekwencji tokenów | Rozkłady prawdopodobieństwa następnego tokena i wygenerowane kontynuacje; Llama |
BERT uczy się reprezentacji dwukierunkowych podczas wstępnego treningu z maskowaniem tokenów. Odpowiednia głowica wyjściowa i trening do danego zadania przekształcają te reprezentacje w klasyfikacje, fragmenty tekstu lub inne predykcje. Standardowy BERT nie jest skonfigurowany jako zwykły generator tekstu od lewej do prawej. Ponadto zagregowane wyjście dowolnego enkodera nie jest automatycznie dobrym embeddingiem do wyszukiwania: takie zastosowanie wymaga odpowiedniego treningu i ewaluacji.
T5 używa enkodera do reprezentowania wejścia oraz dekodera do generowania wyjścia z uwagą skierowaną na te reprezentacje. Może formułować zadania klasyfikacji jako generację tekstu, a także przekształcać sekwencje. Enkoder–dekoder nie oznacza wyłącznie tłumaczenia.
Model z samym dekoderem używa tej samej sekwencji przyczynowej dla instrukcji, przykładów i wygenerowanej kontynuacji. Każda pozycja może kierować uwagę na siebie i wcześniejsze pozycje. Wcześniejsze stany KV pozostają ważne, gdy generacja dodaje tokeny, co umożliwia dekodowanie przyrostowe. Artykuł o Transformerze wyjaśnia różnicę między maskowaniem a uwagą krzyżową.
Wybierz checkpoint do zadania
W przypadku klasyfikacji ze stałymi etykietami lub ekstrakcji porównaj mniejszy model wytrenowany do zadania z generatorem sterowanym promptem. W przypadku wyszukiwania porównaj checkpointy wytrenowane do tworzenia embeddingów lub rerankingu, zamiast kierować się samymi nazwami architektur. Dla elastycznych odpowiedzi, kodu lub argumentów narzędzi oceń model generacyjny pod kątem formatu wyjściowego i błędów, które twoja aplikacja może tolerować.
Sprawdź limity wejścia, obsługiwane języki, wymaganą głowicę wyjściową, jakość, opóźnienie i środowisko wykonawcze wdrożenia. Nazwa rodziny pozwala przewidzieć schemat obliczeń; nie gwarantuje jakości w zadaniu ani tego, że większy model będzie lepszym wyborem.
Przewodnik inżynierski: rodziny modeli wyjaśnia łącznie właściwości generacji i buforowania.