Chinchilla-schaalwetten: verlaagt meer training de LLM-kosten?
Automatische vertaling
Dit artikel is automatisch vertaald vanuit de oorspronkelijke Engelse versie.
Chinchilla-schaalwetten schatten hoe je een vast rekenbudget voor training verdeelt over de grootte van het model en trainingstokens. Ze minimaliseren niet de totale kosten van het model gedurende de hele gebruiksduur voor serving. Een kleiner model dat langer wordt getraind, kan meer kosten om te trainen en minder om te gebruiken, als het aan dezelfde kwaliteitseis voldoet.
Het verwachte inferencevolume bepaalt mede welke investering in training zichzelf kan terugverdienen.
Wat de verhouding van 20 tokens betekent
Het Chinchilla-artikel trainde een model met 70B parameters op 1.4 biljoen tokens. Dat zijn 20 trainingstokens per parameter. De schaalanalyse wees uit dat de grootte van het model en de trainingsdata samen moeten toenemen om trainingsrekenwerk efficiënt te benutten onder de onderzochte aannames.
Beschouw 20:1 als een benaderend punt uit die analyse, niet als een vereiste voor elke architectuur, dataset of deployment. Datakwaliteit, herhaalde voorbeelden, trainingsmethoden en de beoogde taak veranderen wat extra tokens opleveren.
Het Llama 3-rapport beschrijft hoe de kleinere models met veel meer tokens per parameter zijn getraind. Dit volgt een ander economisch doel: een kleiner model verbeteren waarvan de inference na de training mogelijk heel vaak wordt uitgevoerd. Een hogere verhouding vermenigvuldigt de kwaliteit niet en betekent niet dat elke extra token zichzelf terugverdient.
Vergelijk de totale kosten bij de vereiste kwaliteit
Een bruikbare schatting omvat training, verwachte inference en operationele kosten. Stel dat twee kandidaten aan dezelfde drempelwaarde voor de taak voldoen:
| Kandidaat | Eenmalige trainingskosten | Servingkosten per verzoek |
|---|---|---|
| Groter model, kortere training | Lager in dit voorbeeld | Hoger |
| Kleiner model, langere training | Hoger in dit voorbeeld | Lager |
De kleinere kandidaat verdient de extra trainingsuitgaven pas terug na voldoende verzoeken. Deel de extra trainingskosten door de besparing per verzoek om dat aantal verzoeken te schatten. Neem evaluatie, modelupdates en infrastructuurwerk mee voordat je de schatting gebruikt voor een aankoopbeslissing.
Meet kwaliteit en servingkosten met dezelfde verdeling van invoer en uitvoerlengtes. Als het kleinere model nieuwe pogingen, terugvallen op een sterker model of langere uitvoer vereist, neem die kosten dan ook mee.
De sectie over schaalwetten in de LLM Engineering Guide vergelijkt gepubliceerde verhoudingen van trainingstokens tot parameters en onderscheidt de twee doelen.