Wann beschleunigt spekulatives Decoding das LLM-Serving?

Automatische Übersetzung

Dieser Artikel wurde automatisch aus der englischen Originalversion übersetzt.

Spekulatives Decoding kann die Generierung beschleunigen, wenn sich mehrere Token-Kandidaten kostengünstig vorschlagen lassen und das Zielmodell genügend davon akzeptiert. Das Zielmodell verifiziert die Kandidaten gemeinsam und kann dadurch mehrere Ausgabe-Tokens pro Runde liefern. Der zusätzliche Aufwand für die Vorschläge kann Serving dagegen verlangsamen, wenn die Akzeptanz niedrig ist oder das Zielmodell bereits effizient mit großen Batches arbeitet.

Führe einen Benchmark des gesamten Generierungszyklus einschließlich Vorschlägen und Ablehnungen durch, bevor du das Verfahren für einen Dienst auswählst.

Eine Verifizierungsrunde verstehen

Ein Draft-Modell schlägt K Tokens vor. Das Zielmodell bewertet die Kandidatenpositionen in einem gebündelten Forward Pass. Modifiziertes Rejection Sampling akzeptiert Kandidaten von links nach rechts unter Verwendung beider Verteilungen. Nach der ersten Ablehnung zieht es eine Korrektur aus der residualen Zielverteilung und verwirft spätere Kandidaten. Werden alle Kandidaten akzeptiert, kann es zusätzlich ein weiteres Token des Zielmodells ziehen.

Der Speculative-Sampling-Algorithmus von Chen et al. erhält unter seinen Annahmen die Zielverteilung, vorbehaltlich numerischer Effekte der Hardware. Kandidaten lediglich mit den vom Zielmodell ausgewählten Tokens zu vergleichen, ist nicht derselbe Sampling-Algorithmus. Prüfe das Sampling-Verhalten und die unterstützten Einstellungen der gewählten Implementierung.

Die Studie berichtete eine 2–2.5x Beschleunigung des Decodings für das getestete Chinchilla-70B-Zielmodell mit einem 4B-Draft-Modell, Batch-Größe eins und K=4 auf TPU v4. Dieses frühere Ergebnis belegt, dass der Mechanismus helfen kann; es ist keine Prognose für ein anderes Modellpaar.

Prüfen, wovon der Gewinn abhängt

MessgrößeBedeutung
Akzeptierte Tokens pro VerifizierungsrundeWie viel Ausgabe den Ausführungsaufwand des Zielmodells amortisiert
Zeit für die VorschlägeAufwand für das Vorschlagen von Kandidaten
Zeit für Verifizierung und KorrekturArbeit des Zielmodells und Mehraufwand durch abgelehnte Kandidaten
Throughput und Latency nach ParallelitätOb der Gewinn bei realistischen Batches erhalten bleibt
Aufgabenqualität und Sampling-EinstellungenOb die gewählte Methode das beabsichtigte Verhalten erhält

Methoden mit Draft-Modellen sind eine Option. EAGLE-3 kombiniert mehrere Ebenen der Merkmale des Zielmodells und sagt Draft-Tokens direkt voraus; andere Ansätze nutzen zusätzliche Vorhersageköpfe oder Prompt-Abgleiche. Ihre Akzeptanzraten und Ausführungskosten unterscheiden sich.

Teste repräsentativen Code, Fließtext, Structured Outputs und Kontextlängen. Beginne mit einer kleinen Anzahl vorgeschlagener Tokens und variiere sie dann zusammen mit der Parallelität. Mehr Kandidaten helfen nicht, wenn ihr Vorschlags- und Verifizierungsaufwand die eingesparte Arbeit übersteigt.

Engineering-Leitfaden: spekulatives Decoding erklärt die Akzeptanzfolge und die Methodenvarianten.