Dados sintéticos de treino: como gerar exemplos úteis?

Tradução automática

Este artigo foi traduzido automaticamente a partir da versão original em inglês.

Gere exemplos sintéticos para colmatar lacunas específicas nos dados reais de treino. Comece por casos revistos, varie deliberadamente as entradas, verifique as saídas e teste o modelo resultante com exemplos reais reservados para avaliação. Um dataset gerado maior só é útil quando melhora a tarefa que mede.

Use dados sintéticos para alargar uma cobertura que possa verificar, como rótulos em falta, formatos raros ou exemplos com respostas conhecidas.

Defina o que cada exemplo gerado acrescenta

Numa tarefa de extração, identifique primeiro o campo e a falha que precisa de cobrir:

Falha realVariação gerada propostaVerificação da saída
A ausência de um campo leva a um valor inventadoRemover esse campo de documentos que, de resto, são válidosO campo esperado está vazio
A alteração da ordem dos campos prejudica a extraçãoAlterar a disposição mantendo os valoresOs valores continuam a corresponder à fonte
Um rótulo raro é mal classificadoGerar casos diversos para esse rótulo revistoO rótulo passa na revisão

Conserve o caso de origem, o prompt de geração, a identidade do modelo professor e o resultado da validação. Isto permite remover ou voltar a gerar um subconjunto quando uma regra de rotulagem muda.

O Self-Instruct gera e filtra exemplos de instruções a partir de um conjunto inicial. O relatório técnico do Phi-4 descreve métodos mais elaborados de geração, crítica, revisão e inversão de instruções. São opções para produzir dados; os seus resultados publicados não certificam os seus exemplos.

Filtre antes de aumentar o volume

Verifique duplicados, respostas sem fundamento, o equilíbrio dos rótulos, a língua e a dificuldade da tarefa. Use verificadores determinísticos quando o resultado correto é conhecido e revisão humana quando não é. Exclua os casos de avaliação dos prompts de geração e dos dados de treino.

O treino recursivo com dados gerados pode levar à perda de padrões raros. O estudo sobre o colapso dos modelos examina este risco. Um outro estudo sobre a acumulação de dados reais e sintéticos mostra que a estratégia de conservação dos dados altera o resultado. Os exemplos sintéticos não causam inevitavelmente um colapso; a substituição indiscriminada e a geração repetida exigem uma análise particularmente cuidadosa.

Treine com e sem o subconjunto sintético, usando o mesmo orçamento. Conserve-o quando a qualidade nos dados reais reservados melhora sem regressões inaceitáveis, sobretudo nos casos raros.

A secção sobre dados sintéticos do guia de engenharia de LLM explica as principais abordagens de geração.