Encoder- versus decodermodellen: welke architectuur past?

Automatische vertaling

Dit artikel is automatisch vertaald vanuit de oorspronkelijke Engelse versie.

Gebruik een encoder die voor de taak is getraind voor representaties of voorspellingen op basis van een invoer. Gebruik een encoder-decodermodel wanneer een getraind systeem de ene reeks omzet in een andere. Gebruik een decoder-only-taalmodel voor autoregressieve generatie en taken op basis van prompts. De training en de uitvoerinterface van het checkpoint zijn even belangrijk als de naam van de architectuur.

Deze keuzes bieden ingenieurs een nuttig uitgangspunt bij het kiezen van modellen. Ze beperken niet wat een aangepaste architectuur ooit kan doen.

Vergelijk wat elk model teruggeeft

FamilieAttention-patroonTypische uitvoer en voorbeeld
Alleen encoderTokens zien de volledige invoerTokenrepresentaties, labels of tekstfragmenten; BERT
Encoder-decoderEncoder voor de volledige invoer; causale uitvoerdecoder met cross-attentionGegenereerde uitvoerreeks; T5
Alleen decoderCausale attention over de reeks tokensVerdelingen voor het volgende token en gegenereerde voortzettingen; Llama

BERT leert bidirectionele representaties via pretraining met gemaskeerde tokens. Een geschikte uitvoerkop en taakgerichte training zetten die representaties om in classificaties, tekstfragmenten of andere voorspellingen. Standaard-BERT is niet ingesteld als een gewone tekstgenerator van links naar rechts. Ook is de geaggregeerde uitvoer van een willekeurige encoder niet automatisch een goed retrieval-embedding: dat gebruik vereist geschikte training en evaluatie.

T5 gebruikt een encoder om een invoer te representeren en een decoder om een uitvoer te genereren, waarbij de decoder via attention die representaties gebruikt. Het kan classificatietaken als tekstgeneratie formuleren en ook reeksen transformeren. Encoder-decoder betekent niet alleen vertaling.

Een decoder-only-model gebruikt dezelfde causale reeks voor instructies, voorbeelden en de gegenereerde voortzetting. Elke positie kan via attention zichzelf en eerdere posities gebruiken. Eerdere KV-toestanden blijven geldig wanneer de generatie tokens toevoegt, waardoor incrementele decodering mogelijk is. Het Transformer-artikel legt het onderscheid tussen maskering en cross-attention uit.

Kies het checkpoint voor de taak

Vergelijk voor classificatie met vaste labels of extractie een kleiner, taakgericht getraind model met een generator die je met een prompt aanstuurt. Vergelijk voor retrieval getrainde embedding- of reranking-checkpoints in plaats van alleen architectuurnamen. Evalueer voor flexibele antwoorden, code of toolargumenten een generatief model op het uitvoerformaat en de fouten die je toepassing kan verdragen.

Controleer invoerlimieten, ondersteunde talen, de vereiste uitvoerkop, kwaliteit, latency en de runtime voor deployment. Een familienaam voorspelt het rekenpatroon; die garandeert geen kwaliteit op een taak en maakt een groter model niet automatisch de betere keuze.

Engineeringgids: modelfamilies legt de eigenschappen van generatie en caching samen uit.