Синтетические обучающие данные: как создавать полезные примеры?

Автоматический перевод

Эта статья была автоматически переведена с оригинальной английской версии.

Создавайте синтетические примеры, чтобы заполнить конкретные пробелы в реальных обучающих данных. Начните с проверенных случаев, целенаправленно меняйте входные данные, проверяйте выходные данные и тестируйте полученную модель на реальных отложенных примерах. Более крупный сгенерированный датасет полезен только тогда, когда он улучшает результат в измеряемой задаче.

Используйте синтетические данные для расширения покрытия, которое можно проверить: например, для недостающих меток, редких форматов или примеров с известными ответами.

Определите, что добавляет каждый сгенерированный пример

Для задачи извлечения сначала укажите поле и ошибку, которые нужно покрыть:

Реальная ошибкаПредлагаемый сгенерированный вариантПроверка выходных данных
Отсутствие поля приводит к выдуманному значениюУдалите это поле из документов, которые в остальном корректныОжидаемое поле пусто
Изменение порядка полей нарушает извлечениеИзмените расположение, сохранив значенияЗначения по-прежнему совпадают с источником
Редкая метка классифицируется неверноСоздайте разнообразные случаи для этой проверенной меткиМетка проходит проверку

Сохраняйте исходный случай, промпт генерации, сведения о модели-учителе и результат валидации. Это позволит удалить или заново сгенерировать подмножество, когда изменится правило разметки.

Self-Instruct генерирует и фильтрует примеры инструкций на основе начального набора. Технический отчёт Phi-4 описывает более сложные методы генерации, критики, доработки и инверсии инструкций. Это способы создания данных; опубликованные результаты не подтверждают качество ваших примеров.

Фильтруйте данные, прежде чем увеличивать объём

Проверяйте дубликаты, неподтверждённые ответы, баланс меток, язык и сложность задачи. Используйте детерминированные проверки, когда правильный результат известен, и проверку человеком, когда он неизвестен. Не включайте примеры для оценки в промпты генерации и обучающие данные.

Рекурсивное обучение на сгенерированных данных может приводить к потере редких закономерностей. Исследование коллапса моделей рассматривает этот риск. Отдельное исследование накопления реальных и синтетических данных показывает, что стратегия сохранения данных меняет результат. Синтетические примеры не обязательно вызывают коллапс; неизбирательная замена данных и повторная генерация требуют особо тщательной проверки.

Обучите модель с синтетическим подмножеством и без него при одинаковом бюджете. Сохраните его, если качество на реальных отложенных данных улучшилось без неприемлемого ухудшения результатов, особенно на редких случаях.

Раздел о синтетических данных в руководстве по LLM-инжинирингу объясняет основные подходы к генерации.