Wanneer maakt speculatieve decoding LLM-serving sneller?
Automatische vertaling
Dit artikel is automatisch vertaald vanuit de oorspronkelijke Engelse versie.
Speculatieve decoding kan de generatie versnellen wanneer het weinig kost om meerdere kandidaat-tokens voor te stellen en het doelmodel er voldoende accepteert. Het doelmodel verifieert de kandidaten samen en kan daardoor meerdere uitvoer-tokens per ronde teruggeven. Het extra werk voor voorstellen kan serving juist vertragen wanneer de acceptatie laag is of het doelmodel al efficiënt met grote batches werkt.
Voer een benchmark uit van de volledige generatiecyclus, inclusief voorstellen en afwijzingen, voordat je deze methode voor een dienst kiest.
Begrijp een verificatieronde
Een draft-model stelt K tokens voor. Het doelmodel beoordeelt de kandidaatposities in een gebatchte forward pass. Aangepaste rejection sampling accepteert kandidaten van links naar rechts op basis van beide verdelingen. Na de eerste afwijzing trekt het een correctie uit de residuele doelverdeling en verwerpt het de latere kandidaten. Als alle kandidaten worden geaccepteerd, kan het ook één extra token van het doelmodel trekken.
Het speculative-sampling-algoritme van Chen et al. behoudt de doelverdeling onder de aannames van het algoritme, met beperkingen door de numerieke berekeningen op de hardware. Alleen kandidaat-tokens vergelijken met tokens die het doelmodel selecteert, is niet hetzelfde sampling-algoritme. Controleer het sampling-gedrag en de ondersteunde instellingen van de gekozen implementatie.
Het artikel rapporteerde 2–2.5x snellere decoding voor het geteste Chinchilla-70B-doelmodel met een 4B-draft-model, batchgrootte één en K=4 op TPU v4. Dit historische resultaat toont aan dat het mechanisme kan helpen; het voorspelt niet de prestaties van een ander modelpaar.
Controleer wat de winst bepaalt
| Meting | Interpretatie |
|---|---|
| Geaccepteerde tokens per verificatieronde | Hoeveel uitvoer de uitvoering van het doelmodel amortiseert |
| Tijd voor voorstellen | Kosten van het voorstellen van kandidaten |
| Verificatie- en correctietijd | Werk van het doelmodel en extra kosten van afgewezen kandidaten |
| Throughput en latency per mate van gelijktijdigheid | Of de winst bij realistische batches behouden blijft |
| Taakkwaliteit en sampling-instellingen | Of de gekozen methode het bedoelde gedrag behoudt |
Methoden met draft-models zijn één optie. EAGLE-3 combineert meerdere niveaus van kenmerken van het doelmodel en voorspelt draft-tokens direct; andere benaderingen gebruiken extra voorspellingskoppen of overeenkomsten met de prompt. Hun acceptatiepercentages en uitvoeringskosten verschillen.
Test representatieve code, proza, structured outputs en contextlengtes. Begin met een klein aantal voorgestelde tokens en varieer dat vervolgens samen met de mate van gelijktijdigheid. Meer kandidaten helpen niet als hun voorstel- en verificatiekosten hoger zijn dan het werk dat je ermee bespaart.
Engineeringgids: speculatieve decoding legt de acceptatievolgorde en de methodevarianten uit.