Wann beschleunigt spekulatives Decoding das LLM-Serving?
Automatische Übersetzung
Dieser Artikel wurde automatisch aus der englischen Originalversion übersetzt.
Spekulatives Decoding kann die Generierung beschleunigen, wenn sich mehrere Token-Kandidaten kostengünstig vorschlagen lassen und das Zielmodell genügend davon akzeptiert. Das Zielmodell verifiziert die Kandidaten gemeinsam und kann dadurch mehrere Ausgabe-Tokens pro Runde liefern. Der zusätzliche Aufwand für die Vorschläge kann Serving dagegen verlangsamen, wenn die Akzeptanz niedrig ist oder das Zielmodell bereits effizient mit großen Batches arbeitet.
Führe einen Benchmark des gesamten Generierungszyklus einschließlich Vorschlägen und Ablehnungen durch, bevor du das Verfahren für einen Dienst auswählst.
Eine Verifizierungsrunde verstehen
Ein Draft-Modell schlägt K Tokens vor. Das Zielmodell bewertet die Kandidatenpositionen in einem gebündelten Forward Pass. Modifiziertes Rejection Sampling akzeptiert Kandidaten von links nach rechts unter Verwendung beider Verteilungen. Nach der ersten Ablehnung zieht es eine Korrektur aus der residualen Zielverteilung und verwirft spätere Kandidaten. Werden alle Kandidaten akzeptiert, kann es zusätzlich ein weiteres Token des Zielmodells ziehen.
Der Speculative-Sampling-Algorithmus von Chen et al. erhält unter seinen Annahmen die Zielverteilung, vorbehaltlich numerischer Effekte der Hardware. Kandidaten lediglich mit den vom Zielmodell ausgewählten Tokens zu vergleichen, ist nicht derselbe Sampling-Algorithmus. Prüfe das Sampling-Verhalten und die unterstützten Einstellungen der gewählten Implementierung.
Die Studie berichtete eine 2–2.5x Beschleunigung des Decodings für das getestete Chinchilla-70B-Zielmodell mit einem 4B-Draft-Modell, Batch-Größe eins und K=4 auf TPU v4. Dieses frühere Ergebnis belegt, dass der Mechanismus helfen kann; es ist keine Prognose für ein anderes Modellpaar.
Prüfen, wovon der Gewinn abhängt
| Messgröße | Bedeutung |
|---|---|
| Akzeptierte Tokens pro Verifizierungsrunde | Wie viel Ausgabe den Ausführungsaufwand des Zielmodells amortisiert |
| Zeit für die Vorschläge | Aufwand für das Vorschlagen von Kandidaten |
| Zeit für Verifizierung und Korrektur | Arbeit des Zielmodells und Mehraufwand durch abgelehnte Kandidaten |
| Throughput und Latency nach Parallelität | Ob der Gewinn bei realistischen Batches erhalten bleibt |
| Aufgabenqualität und Sampling-Einstellungen | Ob die gewählte Methode das beabsichtigte Verhalten erhält |
Methoden mit Draft-Modellen sind eine Option. EAGLE-3 kombiniert mehrere Ebenen der Merkmale des Zielmodells und sagt Draft-Tokens direkt voraus; andere Ansätze nutzen zusätzliche Vorhersageköpfe oder Prompt-Abgleiche. Ihre Akzeptanzraten und Ausführungskosten unterscheiden sich.
Teste repräsentativen Code, Fließtext, Structured Outputs und Kontextlängen. Beginne mit einer kleinen Anzahl vorgeschlagener Tokens und variiere sie dann zusammen mit der Parallelität. Mehr Kandidaten helfen nicht, wenn ihr Vorschlags- und Verifizierungsaufwand die eingesparte Arbeit übersteigt.
Engineering-Leitfaden: spekulatives Decoding erklärt die Akzeptanzfolge und die Methodenvarianten.