LLM-distillatie: hoe leren kleine models van leraren?
Automatische vertaling
Dit artikel is automatisch vertaald vanuit de oorspronkelijke Engelse versie.
LLM-distillatie traint een leerlingmodel met signalen van een lerarenmodel. Methoden op basis van logits stemmen uitvoerverdelingen op elkaar af. Methoden op basis van data trainen met voorbeelden die de leraar genereert. Overweeg distillatie als een kleiner model een vastgestelde grens voor een taak kan halen tegen lagere serving-kosten.
Distillatie garandeert niet dat de leerling alle vaardigheden van de leraar behoudt. De dekking van de data en de evaluatietaak bepalen wat wordt overgedragen.
Twee manieren om gedrag over te dragen
| Methode | Informatie van de leraar | Belangrijkste vereiste |
|---|---|---|
| Distillatie op basis van logits | Tokenkansen of logits | Toegang tot verdelingen en een compatibel trainingsdoel |
| Distillatie op basis van data | Gegenereerde invoer-uitvoervoorbeelden | Gecontroleerde of gefilterde voorbeelden en fine-tuning van de leerling |
Een leraar die alleen via een API toegankelijk is, kan distillatie op basis van data ondersteunen, ook als hij de verdelingen die jouw trainingsmethode met logits nodig heeft niet beschikbaar stelt. Verschillende tokenizers of architecturen kunnen het direct afstemmen van verdelingen ingewikkelder maken.
Het DeepSeek-R1-rapport beschrijft fine-tuning van kleinere Qwen- en Llama-models met een zorgvuldig samengestelde mix van ongeveer 800,000 voorbeelden. De gedistilleerde models presteerden goed op de reasoning-benchmarks van het artikel. Die resultaten tonen aan dat de overdracht in die opzet werkte; ze tonen niet aan dat een kleine leerling elke leraar voor elke werklast kan vervangen.
Maak voorbeelden voor een meetbare taak
Geef voor een classifier voor supportvragen echte vraagtypen en laat de leraar labels en uitleg voorstellen. Controleer labels aan de hand van een beoordeelde taxonomie; wijs ongefundeerde classificaties af. Neem zeldzame klassen en dubbelzinnige gevallen op in plaats van veel eenvoudige parafrases van veelvoorkomende verzoeken te maken.
Houd trainingsvoorbeelden van de leraar gescheiden van de apart gehouden evaluatieset. Anders kan de leerling goed lijken doordat de test trainingsvoorbeelden hergebruikt in plaats van ongeziene gevallen te meten. Controleer voordat je de dataset genereert of de voorwaarden van de leraar het beoogde gebruik voor training toestaan.
Vergelijk de leerling met zowel de leraar als zijn eigen basismodel zonder fine-tuning. Meet de kwaliteit op de taak, fouttypen, uitvoerlengte, latency en kosten bij het beoogde aantal gelijktijdige verzoeken. Neem ook terugvalaanroepen naar de leraar mee wanneer je de besparing schat.
Gebruik uitleg van de leraar alleen wanneer die het gemeten gedrag van de leerling verbetert; langere doelteksten voor training kosten ook meer om te genereren en te leren.
De sectie over distillatie in de LLM Engineering Guide beschrijft de gepubliceerde R1-vergelijkingen en hun beperkingen.