Дистилляция LLM: как небольшие модели учатся у учителей?
Автоматический перевод
Эта статья была автоматически переведена с оригинальной английской версии.
Дистилляция LLM обучает модель-ученика с помощью сигналов, которые создаёт модель-учитель. Методы на основе логитов согласуют выходные распределения. Методы на основе данных обучают ученика на примерах, сгенерированных учителем. Рассмотрите дистилляцию, если меньшая модель может достичь заданного порога качества для задачи при меньшей стоимости сервинга.
Дистилляция не гарантирует, что ученик сохранит все возможности учителя. Охват данных и задача оценки определяют, что удастся перенести.
Два способа перенести поведение
| Метод | Информация от учителя | Основное требование |
|---|---|---|
| Дистилляция на основе логитов | Вероятности токенов или логиты | Доступ к распределениям и совместимая цель обучения |
| Дистилляция на основе данных | Сгенерированные примеры входных и выходных данных | Проверенные или отфильтрованные примеры и файн-тюнинг ученика |
Учитель, доступный только через API, может использоваться для дистилляции на основе данных, даже если он не предоставляет распределения, необходимые вашему методу обучения на логитах. Различия в токенизаторах или архитектурах могут усложнить прямое согласование распределений.
Отчёт DeepSeek-R1 описывает файн-тюнинг меньших моделей Qwen и Llama на тщательно отобранной смеси примерно из 800,000 примеров. Дистиллированные модели показали хорошие результаты на бенчмарках ризонинга из публикации. Эти результаты подтверждают, что перенос сработал в этой конфигурации; они не показывают, что небольшой ученик способен заменить любого учителя при любой нагрузке.
Создавайте примеры для измеримой задачи
Для классификатора обращений в поддержку используйте реальные типы вопросов и попросите учителя предложить метки и объяснения. Сверяйте метки с проверенной таксономией; отклоняйте необоснованные классификации. Включайте редкие классы и неоднозначные случаи вместо множества простых перефразирований распространённых запросов.
Отделяйте сгенерированные учителем обучающие примеры от отложенного набора для оценки. Иначе ученик может казаться эффективным, потому что тест повторно использует обучающие примеры, а не измеряет качество на новых случаях. Перед генерацией датасета проверьте, разрешают ли условия использования учителя предполагаемое применение для обучения.
Сравните ученика как с учителем, так и с его собственной базовой моделью без дополнительного обучения. Измерьте качество выполнения задачи, типы ошибок, длину ответов, латентность и стоимость при предполагаемом числе одновременных запросов. Учитывайте резервные вызовы учителя при оценке экономии.
Используйте объяснения учителя только тогда, когда они улучшают измеряемое поведение ученика; более длинные целевые ответы также дороже генерировать и использовать при обучении.
Раздел о дистилляции в LLM Engineering Guide описывает опубликованные сравнения R1 и их ограничения.