Pretraining vs. Fine-Tuning: Wie unterscheiden sich die Trainingsphasen von LLMs?

Automatische Übersetzung

Dieser Artikel wurde automatisch aus der englischen Originalversion übersetzt.

Pretraining entwickelt allgemeine Fähigkeiten anhand eines großen Textkorpus. Überwachtes Fine-Tuning bringt einem Modell anhand von Beispielen bei, die gewünschten Antworten zu erzeugen. Alignment-Verfahren trainieren es auf Präferenzen oder überprüfbare Belohnungen. Diese Verfahren verfolgen unterschiedliche Trainingsziele; ein nützliches Modell kann alle drei durchlaufen.

Beginne mit dem Verhalten, das sich ändern muss. Ein fehlendes Dokument, ein wiederholter Klassifikationsfehler und eine unsichere Aktion erfordern unterschiedliche Maßnahmen.

Was verändert sich in jeder Phase?

PhaseTrainingssignalZu bewertendes Ergebnis
PretrainingBei einem autoregressiven LLM: das nächste Token im Korpustext vorhersagenAllgemeine Sprach- und Aufgabenfähigkeiten
Überwachtes Fine-Tuning, kurz SFTBeispiele mit Eingabe und gewünschter AntwortVerhalten bei der anhand von Beispielen gezeigten Aufgabe
Präferenz- oder BelohnungstrainingAntwortpaare mit einer bevorzugten Antwort, erlernte Bewertungen oder regelbasierte PrüfungenDas belohnte Verhalten und unerwünschte Nebenwirkungen

Der technische Bericht zu Llama 3 unterscheidet umfangreiches Pretraining von Post-Training, das die Befolgung von Anweisungen und andere Fähigkeiten entwickelt. Pretraining ist nicht immer die Vorhersage des nächsten Tokens: Encoder-Modelle und Modelle zur Rauschunterdrückung können andere Ziele verwenden.

SFT ist meist der direktere Einstieg, wenn geprüfte Beispiele die gewünschte Ausgabe zeigen. Ein Extraktions-Dataset kann beispielsweise ein Dokument mit den korrekten Feldern verknüpfen. Präferenztraining passt zu Vergleichen, etwa welche von zwei Antworten eine Richtlinie besser befolgt. DPO optimiert Präferenzpaare direkt, während eine herkömmliche RLHF-Pipeline ein Belohnungsmodell trainiert und anschließend die Policy durch bestärkendes Lernen aktualisiert.

Nach dem beobachteten Fehler entscheiden

Wenn Antworten veränderliche oder private Fakten benötigen, stelle diese Fakten zunächst durch Retrieval bereit. Wenn das Modell trotz eines klaren Prompts wiederholt die falschen Labels verwendet, teste SFT mit geprüften Beispielen. Wenn mehrere akzeptable Antworten sich in einer Präferenz unterscheiden, die du konsistent beurteilen kannst, ziehe Präferenztraining in Betracht.

Behalte für jede Änderung einen vom Training getrennten Evaluationsdatensatz bei. Prüfe das Zielverhalten, Verschlechterungen bei allgemeinen Aufgaben, Antwortverweigerungen und Kosten. Ein geringerer Trainingsverlust belegt nicht, dass sich das eingesetzte System verbessert hat.

Zur Entscheidung auf Anwendungsebene siehe Fine-Tuning vs. RAG vs. Prompting. Der Abschnitt zu Trainingsphasen im LLM Engineering Guide liefert den weiteren Kontext.