Quand le décodage spéculatif accélère-t-il le serving des LLM ?

Traduction automatique

Cet article a été traduit automatiquement depuis la version originale en anglais.

Le décodage spéculatif peut accélérer la génération lorsque proposer plusieurs tokens candidats coûte peu et que le modèle cible en accepte suffisamment. Le modèle cible vérifie les candidats ensemble et peut ainsi renvoyer plusieurs tokens de sortie par tour. Le travail de proposition supplémentaire peut au contraire ralentir le serving lorsque le taux d’acceptation est faible ou que le modèle cible fonctionne déjà efficacement avec de grands lots.

Mesurez le cycle de génération complet, y compris les propositions et les rejets, avant de choisir cette méthode pour un service.

Comprendre un tour de vérification

Un modèle de proposition suggère K tokens. Le modèle cible évalue les positions candidates dans une passe avant par lots. Un échantillonnage par rejet modifié accepte les candidats de gauche à droite en utilisant les deux distributions. Après le premier rejet, il tire une correction dans la distribution résiduelle du modèle cible et abandonne les candidats suivants. Si tous les candidats sont acceptés, il peut aussi tirer un token supplémentaire du modèle cible.

L’algorithme d’échantillonnage spéculatif de Chen et al. préserve la distribution cible sous les hypothèses de l’algorithme, sous réserve des effets numériques du matériel. Comparer simplement les tokens candidats aux tokens sélectionnés par le modèle cible ne constitue pas le même algorithme d’échantillonnage. Vérifiez le comportement d’échantillonnage et les réglages pris en charge par l’implémentation choisie.

L’article a rapporté une accélération du décodage de 2–2.5x pour le modèle cible Chinchilla-70B testé, avec un modèle de proposition de 4B, un lot de taille un et K=4 sur TPU v4. Ce résultat historique montre que le mécanisme peut être utile, mais ne prédit pas les performances d’une autre paire de modèles.

Vérifier ce qui détermine le gain

MesureInterprétation
Tokens acceptés par tour de vérificationQuelle quantité de sortie amortit l’exécution du modèle cible
Temps de propositionCoût de la proposition des candidats
Temps de vérification et de correctionTravail du modèle cible et surcoût des candidats rejetés
Débit et latence selon la concurrenceSi le gain persiste avec des lots réalistes
Qualité des tâches et réglages d’échantillonnageSi la méthode choisie préserve le comportement prévu

Les méthodes utilisant un modèle de proposition sont une option. EAGLE-3 combine plusieurs niveaux de caractéristiques du modèle cible et prédit directement les tokens proposés ; d’autres approches utilisent des têtes de prédiction supplémentaires ou des correspondances avec le prompt. Leurs taux d’acceptation et leurs coûts d’exécution diffèrent.

Testez du code, de la prose, des structured outputs et des longueurs de contexte représentatifs. Commencez par un petit nombre de tokens proposés, puis faites-le varier avec la concurrence. Ajouter des candidats n’aide pas si leur coût de proposition et de vérification dépasse le travail évité.

Guide d’ingénierie : décodage spéculatif explique la séquence d’acceptation et les variantes de la méthode.