Dados sintéticos de treino: como gerar exemplos úteis?
Tradução automática
Este artigo foi traduzido automaticamente a partir da versão original em inglês.
Gere exemplos sintéticos para colmatar lacunas específicas nos dados reais de treino. Comece por casos revistos, varie deliberadamente as entradas, verifique as saídas e teste o modelo resultante com exemplos reais reservados para avaliação. Um dataset gerado maior só é útil quando melhora a tarefa que mede.
Use dados sintéticos para alargar uma cobertura que possa verificar, como rótulos em falta, formatos raros ou exemplos com respostas conhecidas.
Defina o que cada exemplo gerado acrescenta
Numa tarefa de extração, identifique primeiro o campo e a falha que precisa de cobrir:
| Falha real | Variação gerada proposta | Verificação da saída |
|---|---|---|
| A ausência de um campo leva a um valor inventado | Remover esse campo de documentos que, de resto, são válidos | O campo esperado está vazio |
| A alteração da ordem dos campos prejudica a extração | Alterar a disposição mantendo os valores | Os valores continuam a corresponder à fonte |
| Um rótulo raro é mal classificado | Gerar casos diversos para esse rótulo revisto | O rótulo passa na revisão |
Conserve o caso de origem, o prompt de geração, a identidade do modelo professor e o resultado da validação. Isto permite remover ou voltar a gerar um subconjunto quando uma regra de rotulagem muda.
O Self-Instruct gera e filtra exemplos de instruções a partir de um conjunto inicial. O relatório técnico do Phi-4 descreve métodos mais elaborados de geração, crítica, revisão e inversão de instruções. São opções para produzir dados; os seus resultados publicados não certificam os seus exemplos.
Filtre antes de aumentar o volume
Verifique duplicados, respostas sem fundamento, o equilíbrio dos rótulos, a língua e a dificuldade da tarefa. Use verificadores determinísticos quando o resultado correto é conhecido e revisão humana quando não é. Exclua os casos de avaliação dos prompts de geração e dos dados de treino.
O treino recursivo com dados gerados pode levar à perda de padrões raros. O estudo sobre o colapso dos modelos examina este risco. Um outro estudo sobre a acumulação de dados reais e sintéticos mostra que a estratégia de conservação dos dados altera o resultado. Os exemplos sintéticos não causam inevitavelmente um colapso; a substituição indiscriminada e a geração repetida exigem uma análise particularmente cuidadosa.
Treine com e sem o subconjunto sintético, usando o mesmo orçamento. Conserve-o quando a qualidade nos dados reais reservados melhora sem regressões inaceitáveis, sobretudo nos casos raros.
A secção sobre dados sintéticos do guia de engenharia de LLM explica as principais abordagens de geração.