Претрейнинг и файн-тюнинг: чем отличаются этапы обучения LLM?

Автоматический перевод

Эта статья была автоматически переведена с оригинальной английской версии.

Претрейнинг развивает общие способности на основе большого корпуса текстов. Файн-тюнинг с учителем обучает модель выдавать нужные ответы по примерам. Методы согласования с предпочтениями и целями обучают её на основе предпочтений или проверяемых вознаграждений. У этих методов разные цели обучения; полезная модель может пройти все три этапа.

Начните с поведения, которое нужно изменить. Отсутствующий документ, повторяющаяся ошибка классификации и небезопасное действие требуют разных мер.

Что меняется на каждом этапе?

ЭтапОбучающий сигналКакой результат оценивать
ПретрейнингДля авторегрессионной LLM — предсказание следующего токена в тексте корпусаОбщие языковые способности и способность решать задачи
Файн-тюнинг с учителем, или SFTПримеры входных данных и нужных ответовПоведение на задаче, показанной в примерах
Обучение на предпочтениях или вознагражденияхПары ответов с предпочтительным ответом, оценки обученной модели или проверки по правиламПоощряемое поведение и нежелательные побочные эффекты

Технический отчёт Llama 3 разделяет масштабный претрейнинг и пост-трейнинг, который развивает следование инструкциям и другие способности. Претрейнинг не всегда сводится к предсказанию следующего токена: энкодерные модели и модели удаления шума могут использовать другие цели.

SFT обычно даёт более прямой путь к результату, когда проверенные примеры показывают нужный ответ. Например, датасет для извлечения данных может сопоставлять документ с правильными полями. Обучение на предпочтениях подходит для сравнений: например, какой из двух ответов лучше соблюдает правила. DPO напрямую оптимизирует пары предпочтений, а обычный пайплайн RLHF обучает модель вознаграждения и затем обновляет политику с помощью обучения с подкреплением.

Выбирайте метод по наблюдаемой ошибке

Если для ответов нужны меняющиеся или закрытые сведения, сначала предоставьте их через retrieval. Если модель постоянно использует неправильные метки, несмотря на ясный промпт, протестируйте SFT на проверенных примерах. Если несколько приемлемых ответов различаются по предпочтению, которое вы можете оценивать последовательно, рассмотрите обучение на предпочтениях.

При каждом изменении сохраняйте оценочный набор, который не используется в обучении. Проверяйте целевое поведение, ухудшения на общих задачах, отказы и стоимость. Снижение функции потерь при обучении не доказывает, что развёрнутая система стала работать лучше.

О выборе на уровне приложения читайте в статье файн-тюнинг, RAG или промптинг. Раздел об этапах обучения в Руководстве по LLM-инжинирингу даёт более широкий контекст.