Законы масштабирования Chinchilla: снижает ли более долгое обучение стоимость LLM?

Автоматический перевод

Эта статья была автоматически переведена с оригинальной английской версии.

Законы масштабирования Chinchilla оценивают, как распределить фиксированный бюджет вычислений на обучение между размером модели и числом обучающих токенов. Они не минимизируют полную стоимость модели за весь срок её использования в сервинге. Меньшая модель, которую обучали дольше, может стоить дороже в обучении и дешевле в сервинге, если она отвечает тем же требованиям к качеству.

Ожидаемый объём инференса влияет на то, какие вложения в обучение могут окупиться.

Что означает соотношение 20 токенов на параметр

В статье о Chinchilla модель с 70B параметров обучили на 1.4 триллиона токенов. Это 20 обучающих токенов на параметр. Анализ масштабирования показал, что при исследованных допущениях размер модели и объём обучающих данных должны расти вместе для эффективного использования вычислений на обучение.

Считайте 20:1 приблизительным значением из этого анализа, а не требованием для любой архитектуры, датасета или деплоя. Качество данных, повторяющиеся примеры, методы обучения и целевая задача влияют на результат от дополнительных токенов.

В отчёте о Llama 3 описано обучение меньших моделей на гораздо большем числе токенов на параметр. Здесь другая экономическая цель: улучшить меньшую модель, инференс которой после обучения может выполняться много раз. Более высокое соотношение не умножает качество и не означает, что каждый дополнительный токен окупается.

Сравните полную стоимость при требуемом качестве

Полезная оценка включает обучение, ожидаемый инференс и эксплуатационные расходы. Допустим, два кандидата достигают одного и того же порога качества для задачи:

КандидатРазовые расходы на обучениеСтоимость сервинга на запрос
Большая модель, более короткое обучениеНиже в этом примереВыше
Меньшая модель, более долгое обучениеВыше в этом примереНиже

Меньшая модель окупает дополнительные расходы на обучение только после достаточного числа запросов. Чтобы оценить это число, разделите дополнительные расходы на обучение на экономию с каждого запроса. Учтите оценку качества, обновления модели и работу над инфраструктурой, прежде чем использовать расчёт для решения о покупке.

Измеряйте качество и стоимость сервинга при одинаковом распределении входных данных и длины ответов. Если меньшей модели нужны повторные попытки, обращение к более сильной модели при неудаче или более длинные ответы, учтите и эти расходы.

Раздел о законах масштабирования в LLM Engineering Guide сравнивает опубликованные соотношения обучающих токенов к параметрам и различает эти две цели.