Modele z enkoderem i dekoderem: którą architekturę wybrać?

Tłumaczenie automatyczne

Ten artykuł został automatycznie przetłumaczony z angielskiego oryginału.

Użyj enkodera wytrenowanego do danego zadania, gdy potrzebujesz reprezentacji lub predykcji na podstawie wejścia. Użyj modelu enkoder–dekoder, gdy wytrenowany system przekształca jedną sekwencję w drugą. Użyj modelu językowego z samym dekoderem do generacji autoregresyjnej i zadań opartych na promptach. Trening i interfejs wyjściowy checkpointu mają takie samo znaczenie jak nazwa architektury.

To użyteczne opcje wyjściowe dla inżynierów wybierających modele, a nie ograniczenia tego, co może zrobić dostosowana architektura.

Porównaj, co zwraca każdy model

RodzinaSchemat uwagiTypowe wyjście i przykład
Sam enkoderTokeny widzą całe wejścieReprezentacje tokenów, etykiety lub fragmenty tekstu; BERT
Enkoder–dekoderEnkoder obejmujący całe wejście; przyczynowy dekoder wyjściowy z uwagą krzyżowąWygenerowana sekwencja wyjściowa; T5
Sam dekoderUwaga przyczynowa w sekwencji tokenówRozkłady prawdopodobieństwa następnego tokena i wygenerowane kontynuacje; Llama

BERT uczy się reprezentacji dwukierunkowych podczas wstępnego treningu z maskowaniem tokenów. Odpowiednia głowica wyjściowa i trening do danego zadania przekształcają te reprezentacje w klasyfikacje, fragmenty tekstu lub inne predykcje. Standardowy BERT nie jest skonfigurowany jako zwykły generator tekstu od lewej do prawej. Ponadto zagregowane wyjście dowolnego enkodera nie jest automatycznie dobrym embeddingiem do wyszukiwania: takie zastosowanie wymaga odpowiedniego treningu i ewaluacji.

T5 używa enkodera do reprezentowania wejścia oraz dekodera do generowania wyjścia z uwagą skierowaną na te reprezentacje. Może formułować zadania klasyfikacji jako generację tekstu, a także przekształcać sekwencje. Enkoder–dekoder nie oznacza wyłącznie tłumaczenia.

Model z samym dekoderem używa tej samej sekwencji przyczynowej dla instrukcji, przykładów i wygenerowanej kontynuacji. Każda pozycja może kierować uwagę na siebie i wcześniejsze pozycje. Wcześniejsze stany KV pozostają ważne, gdy generacja dodaje tokeny, co umożliwia dekodowanie przyrostowe. Artykuł o Transformerze wyjaśnia różnicę między maskowaniem a uwagą krzyżową.

Wybierz checkpoint do zadania

W przypadku klasyfikacji ze stałymi etykietami lub ekstrakcji porównaj mniejszy model wytrenowany do zadania z generatorem sterowanym promptem. W przypadku wyszukiwania porównaj checkpointy wytrenowane do tworzenia embeddingów lub rerankingu, zamiast kierować się samymi nazwami architektur. Dla elastycznych odpowiedzi, kodu lub argumentów narzędzi oceń model generacyjny pod kątem formatu wyjściowego i błędów, które twoja aplikacja może tolerować.

Sprawdź limity wejścia, obsługiwane języki, wymaganą głowicę wyjściową, jakość, opóźnienie i środowisko wykonawcze wdrożenia. Nazwa rodziny pozwala przewidzieć schemat obliczeń; nie gwarantuje jakości w zadaniu ani tego, że większy model będzie lepszym wyborem.

Przewodnik inżynierski: rodziny modeli wyjaśnia łącznie właściwości generacji i buforowania.