Modelos de embedding e modelos generativos: o que produz cada um?
Tradução automática
Este artigo foi traduzido automaticamente a partir da versão original em inglês.
Um modelo de embedding representa uma entrada como um vetor para pesquisa por semelhança ou outras tarefas posteriores. Um modelo generativo produz uma sequência, como uma resposta ou structured output. Em RAG, um modelo de embedding ajuda a recuperar informação que sustenta a resposta; um gerador utiliza essa informação para responder.
As duas funções podem usar arquiteturas relacionadas, mas os seus objetivos de treino e as suas saídas são diferentes.
Um vetor é uma representação, não uma resposta
| Propriedade | Modelo de embedding | Modelo generativo |
|---|---|---|
| Saída habitual | Vetor com dimensão fixa | Sequência de tokens de comprimento variável |
| Exemplo de tarefa | Encontrar passagens semelhantes a uma consulta | Explicar passagens ou extrair informação delas |
| Avaliação | Relevância e ordenação dos resultados de recuperação | Correção da resposta e utilização da informação que a sustenta |
Os modelos de embedding de texto podem agregar representações de tokens de um codificador ou de uma arquitetura derivada de um descodificador. A agregação e o treino das representações tornam o vetor útil; calcular a média de estados ocultos arbitrários não comprova a qualidade da recuperação.
Por exemplo, Qwen3-Embedding-8B é um modelo de embedding de texto com dimensões de saída configuráveis e instruções de tarefa. Siga as convenções do modelo para consultas e documentos. As representações compatíveis não têm de usar prefixos de entrada idênticos.
Mantenha a compatibilidade do índice
Guarde a identidade do codificador, a dimensão e o pré-processamento utilizados para indexar os documentos. As consultas devem usar o codificador de consultas correspondente e as suas instruções. Os vetores de versões de modelos sem relação entre si não devem, em geral, entrar na mesma comparação de semelhança, mesmo que as suas dimensões coincidam.
Mudar o gerador pode deixar o índice vetorial utilizável. Mudar o modelo de embedding exige normalmente recalcular os embeddings dos documentos ou realizar outra migração explicitamente testada.
Alguns modelos permitem encurtar os vetores através do treino Matryoshka. O anúncio da OpenAI sobre embeddings indica que uma representação de 256 dimensões de text-embedding-3-large superou, no MTEB, a representação de 1,536 dimensões de ada-002 usada na comparação. É um benchmark específico desse modelo, não uma prova de que menos dimensões preservam sempre a qualidade.
Para o seu corpus, teste a recuperação com consultas anotadas nas dimensões suportadas. Registe a proporção de documentos relevantes recuperados, a ordenação, o armazenamento e a latência de pesquisa. Um gerador de respostas mais capaz não consegue recuperar de forma fiável uma passagem da fonte que a etapa de recuperação nunca forneceu.
A secção sobre modelos de embedding do guia de engenharia de LLM compara exemplos de modelos e explica o truncamento de dimensões.