Pretraining vs. fine-tuning: hoe verschillen de trainingsfasen van LLMs?
Automatische vertaling
Dit artikel is automatisch vertaald vanuit de oorspronkelijke Engelse versie.
Pretraining ontwikkelt brede vaardigheden op basis van een groot corpus. Supervised fine-tuning leert een model met voorbeelden de gewenste antwoorden te produceren. Alignment-methoden trainen het op voorkeuren of verifieerbare beloningen. Deze methoden hebben verschillende trainingsdoelen; een bruikbaar model kan alle drie doorlopen.
Begin bij het gedrag dat moet veranderen. Een ontbrekend document, een terugkerende classificatiefout en een onveilige actie vragen om verschillende ingrepen.
Wat verandert er in elke fase?
| Fase | Trainingssignaal | Te evalueren resultaat |
|---|---|---|
| Pretraining | Voor een autoregressief LLM: het volgende token voorspellen in de corpustekst | Algemene taalvaardigheden en vaardigheden voor taken |
| Supervised fine-tuning, of SFT | Voorbeelden van invoer en gewenste antwoorden | Gedrag bij de taak die de voorbeelden laten zien |
| Training op voorkeuren of beloningen | Antwoordparen met een voorkeursantwoord, aangeleerde scores of controles op basis van regels | Het beloonde gedrag en ongewenste neveneffecten |
Het technische rapport over Llama 3 onderscheidt grootschalige pretraining van post-training die het opvolgen van instructies en andere vaardigheden ontwikkelt. Pretraining bestaat niet altijd uit het voorspellen van het volgende token: encodermodellen en modellen die ruis verwijderen kunnen andere doelen gebruiken.
SFT is meestal het directere startpunt wanneer gecontroleerde voorbeelden de gewenste uitvoer laten zien. Een dataset voor extractie kan bijvoorbeeld een document koppelen aan de juiste velden. Training op voorkeuren past bij vergelijkingen, zoals welk van twee antwoorden een beleidsregel beter volgt. DPO optimaliseert voorkeursparen rechtstreeks, terwijl een gebruikelijke RLHF-pipeline een beloningsmodel traint en daarna de policy bijwerkt via reinforcement learning.
Kies op basis van de waargenomen fout
Als antwoorden veranderlijke of private feiten nodig hebben, bied die feiten dan eerst aan via retrieval. Als het model ondanks een duidelijke prompt herhaaldelijk de verkeerde labels gebruikt, test dan SFT met gecontroleerde voorbeelden. Als meerdere acceptabele antwoorden verschillen in een voorkeur die je consistent kunt beoordelen, overweeg dan training op voorkeuren.
Behoud bij elke wijziging een evaluatieset die buiten de training blijft. Controleer het gewenste gedrag, verslechteringen bij algemene taken, weigeringen en kosten. Een lagere waarde van de verliesfunctie tijdens training bewijst niet dat het gedeployde systeem is verbeterd.
Voor de keuze op applicatieniveau zie fine-tuning vs. RAG vs. prompting. Het onderdeel over trainingsfasen in de LLM Engineering Guide geeft de bredere context.