LLM-Distillation: Wie lernen kleine Models von Lehrermodellen?

Automatische Übersetzung

Dieser Artikel wurde automatisch aus der englischen Originalversion übersetzt.

LLM-Distillation trainiert ein Schülermodell mit Signalen eines Lehrermodells. Logitbasierte Methoden gleichen Ausgabeverteilungen ab. Datenbasierte Methoden trainieren mit Beispielen, die das Lehrermodell erzeugt. Ziehen Sie Distillation in Betracht, wenn ein kleineres Model eine festgelegte Qualitätsgrenze für eine Aufgabe bei niedrigeren Serving-Kosten erreichen könnte.

Distillation garantiert nicht, dass das Schülermodell alle Fähigkeiten des Lehrermodells behält. Die Datenabdeckung und die Evaluationsaufgabe bestimmen, was übertragen wird.

Zwei Wege zur Übertragung von Verhalten

MethodeInformationen des LehrermodellsHauptanforderung
Logitbasierte DistillationToken-Wahrscheinlichkeiten oder LogitsZugang zu Verteilungen und ein kompatibles Trainingsziel
Datenbasierte DistillationGenerierte Eingabe-Ausgabe-BeispieleGeprüfte oder gefilterte Beispiele und Fine-Tuning des Schülermodells

Ein Lehrermodell, das nur über eine API zugänglich ist, kann datenbasierte Distillation ermöglichen, auch wenn es die für Ihre Logit-Trainingsmethode nötigen Verteilungen nicht bereitstellt. Unterschiedliche Tokenizer oder Architekturen können den direkten Abgleich von Verteilungen aufwendiger machen.

Der DeepSeek-R1-Bericht beschreibt das Fine-Tuning kleinerer Qwen- und Llama-Models mit einer kuratierten Mischung aus ungefähr 800,000 Beispielen. Die destillierten Models schnitten auf den Reasoning-Benchmarks der Veröffentlichung gut ab. Diese Ergebnisse zeigen, dass die Übertragung in dieser Konfiguration funktioniert hat; sie zeigen nicht, dass ein kleines Schülermodell beliebige Lehrermodelle bei beliebigen Arbeitslasten ersetzen kann.

Beispiele für eine messbare Aufgabe erstellen

Geben Sie für einen Support-Klassifikator echte Fragetypen vor und lassen Sie das Lehrermodell Labels und Erklärungen vorschlagen. Prüfen Sie die Labels anhand einer geprüften Taxonomie; verwerfen Sie unbegründete Klassifikationen. Berücksichtigen Sie seltene Klassen und mehrdeutige Fälle, statt viele einfache Paraphrasen häufiger Anfragen zu erzeugen.

Trennen Sie die vom Lehrermodell erzeugten Trainingsbeispiele vom zurückgehaltenen Evaluationsdatensatz. Sonst kann das Schülermodell leistungsfähig erscheinen, weil der Test Trainingsbeispiele wiederverwendet, statt unbekannte Fälle zu messen. Prüfen Sie vor der Generierung des Datasets, ob die Nutzungsbedingungen des Lehrermodells den vorgesehenen Trainingseinsatz erlauben.

Vergleichen Sie das Schülermodell sowohl mit dem Lehrermodell als auch mit seinem eigenen Basismodell ohne Fine-Tuning. Messen Sie Aufgabenqualität, Fehlertypen, Ausgabelänge, Latency und Kosten bei der vorgesehenen Anzahl gleichzeitiger Anfragen. Berücksichtigen Sie bei der Schätzung der Einsparungen auch Fallback-Aufrufe an das Lehrermodell.

Verwenden Sie Erklärungen des Lehrermodells nur, wenn sie das gemessene Verhalten des Schülermodells verbessern; längere Trainingszieltexte kosten auch mehr bei der Generierung und beim Lernen.

Der Abschnitt zur Distillation im LLM Engineering Guide beschreibt die veröffentlichten R1-Vergleiche und ihre Grenzen.