Lois de mise à l’échelle de Chinchilla : entraîner davantage réduit-il le coût des LLM ?
Traduction automatique
Cet article a été traduit automatiquement depuis la version originale en anglais.
Les lois de mise à l’échelle de Chinchilla estiment comment répartir un budget fixe de calcul d’entraînement entre la taille du modèle et les tokens d’entraînement. Elles ne minimisent pas le coût total du modèle sur toute sa durée d’utilisation en serving. Un modèle plus petit entraîné plus longtemps peut coûter plus cher à entraîner et moins cher à utiliser, s’il satisfait la même exigence de qualité.
Le volume d’inférence prévu détermine quels investissements dans l’entraînement peuvent être amortis.
Ce que signifie le ratio de 20 tokens
L’article Chinchilla a entraîné un modèle de 70B paramètres sur 1.4 billion de tokens. Cela représente 20 tokens d’entraînement par paramètre. Son analyse de mise à l’échelle a montré que la taille du modèle et les données d’entraînement devaient augmenter ensemble pour utiliser efficacement le calcul d’entraînement, selon les hypothèses étudiées.
Considérez 20:1 comme un point approximatif issu de cette analyse, pas comme une exigence pour toute architecture, tout dataset ou tout déploiement. La qualité des données, les exemples répétés, les méthodes d’entraînement et la tâche visée modifient ce qu’apportent les tokens supplémentaires.
Le rapport Llama 3 décrit l’entraînement de ses petits modèles avec beaucoup plus de tokens par paramètre. Cela répond à un autre objectif économique : améliorer un modèle plus petit dont l’inférence pourra être exécutée de nombreuses fois après l’entraînement. Un ratio plus élevé ne multiplie pas la qualité et ne signifie pas que chaque token supplémentaire amortit son coût.
Comparer le coût total à qualité requise égale
Une estimation utile inclut l’entraînement, l’inférence prévue et les coûts d’exploitation. Supposons que deux candidats atteignent le même seuil pour la tâche :
| Candidat | Coût d’entraînement initial | Coût de serving par requête |
|---|---|---|
| Modèle plus grand, entraînement plus court | Plus faible dans cet exemple | Plus élevé |
| Modèle plus petit, entraînement plus long | Plus élevé dans cet exemple | Plus faible |
Le plus petit candidat ne récupère la dépense d’entraînement supplémentaire qu’après un nombre suffisant de requêtes. Divisez son surcoût d’entraînement par l’économie réalisée par requête pour estimer ce nombre. Incluez l’évaluation, les mises à jour du modèle et les travaux d’infrastructure avant d’utiliser cette estimation pour décider d’un achat.
Mesurez la qualité et le coût de serving avec la même distribution d’entrées et de longueurs de sortie. Si le petit modèle nécessite de nouvelles tentatives, le recours à un modèle plus performant ou des sorties plus longues, incluez aussi ces coûts.
La section sur les lois de mise à l’échelle du LLM Engineering Guide compare les ratios publiés de tokens d’entraînement par paramètre et distingue les deux objectifs.