Синтетические обучающие данные: как создавать полезные примеры?
Автоматический перевод
Эта статья была автоматически переведена с оригинальной английской версии.
Создавайте синтетические примеры, чтобы заполнить конкретные пробелы в реальных обучающих данных. Начните с проверенных случаев, целенаправленно меняйте входные данные, проверяйте выходные данные и тестируйте полученную модель на реальных отложенных примерах. Более крупный сгенерированный датасет полезен только тогда, когда он улучшает результат в измеряемой задаче.
Используйте синтетические данные для расширения покрытия, которое можно проверить: например, для недостающих меток, редких форматов или примеров с известными ответами.
Определите, что добавляет каждый сгенерированный пример
Для задачи извлечения сначала укажите поле и ошибку, которые нужно покрыть:
| Реальная ошибка | Предлагаемый сгенерированный вариант | Проверка выходных данных |
|---|---|---|
| Отсутствие поля приводит к выдуманному значению | Удалите это поле из документов, которые в остальном корректны | Ожидаемое поле пусто |
| Изменение порядка полей нарушает извлечение | Измените расположение, сохранив значения | Значения по-прежнему совпадают с источником |
| Редкая метка классифицируется неверно | Создайте разнообразные случаи для этой проверенной метки | Метка проходит проверку |
Сохраняйте исходный случай, промпт генерации, сведения о модели-учителе и результат валидации. Это позволит удалить или заново сгенерировать подмножество, когда изменится правило разметки.
Self-Instruct генерирует и фильтрует примеры инструкций на основе начального набора. Технический отчёт Phi-4 описывает более сложные методы генерации, критики, доработки и инверсии инструкций. Это способы создания данных; опубликованные результаты не подтверждают качество ваших примеров.
Фильтруйте данные, прежде чем увеличивать объём
Проверяйте дубликаты, неподтверждённые ответы, баланс меток, язык и сложность задачи. Используйте детерминированные проверки, когда правильный результат известен, и проверку человеком, когда он неизвестен. Не включайте примеры для оценки в промпты генерации и обучающие данные.
Рекурсивное обучение на сгенерированных данных может приводить к потере редких закономерностей. Исследование коллапса моделей рассматривает этот риск. Отдельное исследование накопления реальных и синтетических данных показывает, что стратегия сохранения данных меняет результат. Синтетические примеры не обязательно вызывают коллапс; неизбирательная замена данных и повторная генерация требуют особо тщательной проверки.
Обучите модель с синтетическим подмножеством и без него при одинаковом бюджете. Сохраните его, если качество на реальных отложенных данных улучшилось без неприемлемого ухудшения результатов, особенно на редких случаях.
Раздел о синтетических данных в руководстве по LLM-инжинирингу объясняет основные подходы к генерации.