Encoder- und Decoder-Modelle: Welche Architektur passt?
Automatische Übersetzung
Dieser Artikel wurde automatisch aus der englischen Originalversion übersetzt.
Verwenden Sie einen für die Aufgabe trainierten Encoder für Repräsentationen oder Vorhersagen über eine Eingabe. Verwenden Sie ein Encoder-Decoder-Modell, wenn ein trainiertes System eine Sequenz auf eine andere abbildet. Verwenden Sie ein Decoder-only-Sprachmodell für autoregressive Generierung und Aufgaben mit Prompts. Das Training und die Ausgabeschnittstelle des Checkpoints sind genauso wichtig wie der Name der Architektur.
Diese Empfehlungen bieten Entwicklern einen sinnvollen Ausgangspunkt für die Modellauswahl. Sie begrenzen nicht, was eine angepasste Architektur grundsätzlich leisten kann.
Vergleichen Sie, was die Modelle zurückgeben
| Familie | Attention-Muster | Typische Ausgabe und Beispiel |
|---|---|---|
| Nur Encoder | Tokens sehen die gesamte Eingabe | Token-Repräsentationen, Labels oder Textspannen; BERT |
| Encoder-Decoder | Encoder für die gesamte Eingabe; kausaler Ausgabe-Decoder mit Cross-Attention | Generierte Ausgabesequenz; T5 |
| Nur Decoder | Kausale Attention über die Token-Sequenz | Wahrscheinlichkeitsverteilungen für das nächste Token und generierte Fortsetzungen; Llama |
BERT lernt bidirektionale Repräsentationen durch Pretraining mit maskierten Tokens. Ein geeigneter Ausgabekopf und aufgabenspezifisches Training wandeln diese Repräsentationen in Klassifikationen, Textspannen oder andere Vorhersagen um. Standard-BERT ist nicht als gewöhnlicher Textgenerator von links nach rechts konfiguriert. Außerdem ist die aggregierte Ausgabe eines beliebigen Encoders nicht automatisch ein gutes Retrieval-Embedding: Diese Nutzung erfordert geeignetes Training und eine Evaluation.
T5 verwendet einen Encoder, um eine Eingabe zu repräsentieren, und einen Decoder, der eine Ausgabe generiert und dabei per Attention auf diese Repräsentationen zugreift. Es kann sowohl Klassifikationsaufgaben als Textgenerierung ausdrücken als auch Sequenzen umformen. Encoder-Decoder bedeutet nicht nur Übersetzung.
Ein Decoder-only-Modell verwendet dieselbe kausale Sequenz für Anweisungen, Beispiele und die generierte Fortsetzung. Jede Position kann per Attention auf sich selbst und frühere Positionen zugreifen. Die früheren KV-Zustände bleiben gültig, wenn die Generierung Tokens anhängt. Das ermöglicht inkrementelles Decoding. Das Transformer-Paper erläutert den Unterschied zwischen Maskierung und Cross-Attention.
Wählen Sie den Checkpoint für die Aufgabe
Vergleichen Sie für Klassifikation mit festen Labels oder Extraktion ein kleineres, aufgabenspezifisch trainiertes Modell mit einem per Prompt gesteuerten Generator. Vergleichen Sie für Retrieval trainierte Embedding- oder Reranking-Checkpoints statt bloßer Architekturnamen. Bewerten Sie für flexible Antworten, Code oder Tool-Argumente ein generatives Modell anhand des Ausgabeformats und der Fehler, die Ihre Anwendung tolerieren kann.
Prüfen Sie Eingabegrenzen, unterstützte Sprachen, den benötigten Ausgabekopf, Qualität, Latency und die Deployment-Runtime. Die Modellfamilie gibt Hinweise auf das Berechnungsmuster. Sie garantiert weder Aufgabenqualität noch, dass ein größeres Modell die bessere Wahl ist.
Engineering-Leitfaden: Modellfamilien erklärt die Eigenschaften von Generierung und Caching gemeinsam.