Pré-treino vs. fine-tuning: como diferem as etapas de um LLM?

Tradução automática

Este artigo foi traduzido automaticamente a partir da versão original em inglês.

O pré-treino desenvolve capacidades gerais a partir de um grande corpus. O fine-tuning supervisionado ensina um modelo a produzir as respostas pretendidas através de exemplos. Os métodos de alinhamento treinam-no segundo preferências ou recompensas verificáveis. Estes métodos correspondem a objetivos de treino diferentes; um modelo útil pode passar pelos três.

Comece pelo comportamento que precisa de mudar. Um documento em falta, um erro de classificação repetido e uma ação insegura exigem intervenções diferentes.

O que muda em cada etapa?

EtapaSinal de treinoResultado a avaliar
Pré-treinoNum LLM autorregressivo, prever o próximo token no texto do corpusCapacidades gerais de linguagem e de execução de tarefas
Fine-tuning supervisionado, ou SFTExemplos de entrada e de resposta pretendidaComportamento na tarefa demonstrada pelos exemplos
Treino por preferências ou recompensasPares de respostas com uma resposta preferida, pontuações aprendidas ou verificações baseadas em regrasO comportamento recompensado e os efeitos secundários indesejados

O relatório técnico do Llama 3 distingue o pré-treino em grande escala do pós-treino que desenvolve o seguimento de instruções e outras capacidades. O pré-treino nem sempre consiste em prever o próximo token: os modelos codificadores e os modelos de remoção de ruído podem usar outros objetivos.

SFT é geralmente o ponto de partida mais direto quando os exemplos revistos mostram a saída pretendida. Por exemplo, um dataset de extração pode associar um documento aos campos corretos. O treino por preferências adequa-se a comparações, como determinar qual de duas respostas segue melhor uma política. DPO otimiza diretamente os pares de preferências, enquanto um pipeline convencional de RLHF treina um modelo de recompensa e depois atualiza a política através de aprendizagem por reforço.

Escolha com base na falha observada

Se as respostas precisam de factos que mudam ou de informação privada, forneça primeiro esses dados através de recuperação de informação. Se o modelo usa repetidamente as etiquetas erradas apesar de um prompt claro, teste SFT com exemplos revistos. Se várias respostas aceitáveis diferem numa preferência que consegue avaliar de forma consistente, considere o treino por preferências.

Mantenha um conjunto de avaliação separado do treino ao longo de cada alteração. Verifique o comportamento pretendido, as regressões em tarefas gerais, as recusas e o custo. Uma perda de treino menor não demonstra que o sistema em produção melhorou.

Para a escolha ao nível da aplicação, consulte fine-tuning vs. RAG vs. prompting. A secção sobre etapas de treino do Guia de engenharia de LLM apresenta um contexto mais amplo.