Modelos com encoder ou decoder: que arquitetura escolher?
Tradução automática
Este artigo foi traduzido automaticamente a partir da versão original em inglês.
Use um encoder treinado para a tarefa quando precisar de representações ou previsões sobre uma entrada. Use um modelo encoder-decoder quando um sistema treinado transforma uma sequência noutra. Use um modelo de linguagem só com decoder para geração autorregressiva e tarefas baseadas em prompts. O treino e a interface de saída do checkpoint são tão importantes como o nome da arquitetura.
Estas opções são um ponto de partida útil para engenheiros que escolhem modelos, não limites ao que uma arquitetura adaptada pode vir a fazer.
Compare o que cada modelo devolve
| Família | Padrão de atenção | Saída típica e exemplo |
|---|---|---|
| Só encoder | Os tokens veem toda a entrada | Representações de tokens, rótulos ou segmentos de texto; BERT |
| Encoder-decoder | Encoder sobre toda a entrada; decoder de saída causal com atenção cruzada | Sequência de saída gerada; T5 |
| Só decoder | Atenção causal sobre a sequência de tokens | Distribuições do próximo token e continuações geradas; Llama |
BERT aprende representações bidirecionais através de pré-treino com linguagem mascarada. Uma cabeça de saída adequada e treino para a tarefa convertem essas representações em classificações, segmentos de texto ou outras previsões. O BERT padrão não está configurado como um gerador de texto convencional da esquerda para a direita. Além disso, a saída agregada de um encoder qualquer não é automaticamente um bom embedding para pesquisa: essa utilização requer treino e avaliação adequados.
T5 usa um encoder para representar uma entrada e um decoder para gerar uma saída, aplicando atenção a essas representações. Pode expressar tarefas de classificação como geração de texto, além de transformar sequências. Encoder-decoder não significa apenas tradução.
Um modelo só com decoder usa a mesma sequência causal para as instruções, os exemplos e a continuação gerada. Cada posição pode aplicar atenção a si própria e às posições anteriores. Os estados KV anteriores continuam válidos quando a geração acrescenta tokens, o que permite a descodificação incremental. O artigo sobre o Transformer explica a distinção entre mascaramento e atenção cruzada.
Escolha o checkpoint para a tarefa
Para classificação com rótulos fixos ou extração, compare um modelo mais pequeno treinado para a tarefa com um gerador orientado por um prompt. Para pesquisa, compare checkpoints treinados para embeddings ou reranking, em vez de se basear apenas nas designações das arquiteturas. Para respostas flexíveis, código ou argumentos de ferramentas, avalie um modelo generativo tendo em conta o formato de saída e os erros que a sua aplicação pode tolerar.
Verifique os limites de entrada, os idiomas suportados, a cabeça de saída necessária, a qualidade, a latência e o runtime de implantação. A designação de uma família permite prever o padrão de cálculo; não garante qualidade na tarefa nem torna um modelo maior a melhor escolha.
Guia de engenharia: famílias de modelos explica em conjunto as propriedades de geração e de armazenamento em cache.