Chinchilla-Skalierung: Senkt längeres Training die LLM-Kosten?
Automatische Übersetzung
Dieser Artikel wurde automatisch aus der englischen Originalversion übersetzt.
Die Chinchilla-Skalierung schätzt, wie sich ein festes Rechenbudget für das Training auf Model-Größe und Trainings-Tokens verteilen lässt. Sie minimiert nicht die Gesamtkosten des Models über seine gesamte Serving-Nutzungsdauer. Ein kleineres Model mit längerem Training kann höhere Trainingskosten und niedrigere Serving-Kosten haben, wenn es dieselbe Qualitätsanforderung erfüllt.
Das erwartete Inference-Volumen bestimmt mit, welche Investition in das Training sich amortisieren kann.
Was das Verhältnis von 20 Tokens bedeutet
Die Chinchilla-Studie trainierte ein Model mit 70B Parametern auf 1.4 Billionen Tokens. Das entspricht 20 Trainings-Tokens pro Parameter. Ihre Skalierungsanalyse zeigte, dass Model-Größe und Trainingsdaten unter den untersuchten Annahmen gemeinsam wachsen sollten, um den Rechenaufwand für das Training effizient zu nutzen.
Betrachten Sie 20:1 als ungefähren Wert aus dieser Analyse, nicht als Vorgabe für jede Architektur, jedes Dataset oder jedes Deployment. Datenqualität, wiederholte Beispiele, Trainingsmethoden und die Zielaufgabe beeinflussen, was zusätzliche Tokens bewirken.
Der Llama-3-Bericht beschreibt, dass die kleineren Models mit deutlich mehr Tokens pro Parameter trainiert wurden. Dahinter steht ein anderes wirtschaftliches Ziel: ein kleineres Model zu verbessern, dessen Inference nach dem Training möglicherweise sehr oft ausgeführt wird. Das höhere Verhältnis vervielfacht nicht die Qualität und bedeutet nicht, dass sich jeder zusätzliche Token lohnt.
Gesamtkosten bei der erforderlichen Qualität vergleichen
Eine sinnvolle Schätzung umfasst Training, erwartete Inference und Betriebskosten. Nehmen wir an, zwei Kandidaten erfüllen dieselbe Qualitätsanforderung für die Aufgabe:
| Kandidat | Einmalige Trainingskosten | Serving-Kosten pro Anfrage |
|---|---|---|
| Größeres Model, kürzeres Training | In diesem Beispiel niedriger | Höher |
| Kleineres Model, längeres Training | In diesem Beispiel höher | Niedriger |
Der kleinere Kandidat gleicht die zusätzlichen Trainingsausgaben erst nach genügend Anfragen aus. Teilen Sie seine zusätzlichen Trainingskosten durch die Einsparung pro Anfrage, um diese Anzahl zu schätzen. Berücksichtigen Sie Evaluation, Model-Updates und Infrastrukturarbeiten, bevor Sie die Schätzung für eine Kaufentscheidung verwenden.
Messen Sie Qualität und Serving-Kosten mit derselben Verteilung von Eingaben und Ausgabelängen. Wenn das kleinere Model erneute Versuche, den Rückgriff auf ein leistungsfähigeres Model oder längere Ausgaben benötigt, berücksichtigen Sie auch diese Kosten.
Der Abschnitt zu Skalierungsgesetzen im LLM Engineering Guide vergleicht veröffentlichte Verhältnisse von Trainings-Tokens zu Parametern und unterscheidet die beiden Ziele.