Modelos de embedding e modelos generativos: o que produz cada um?

Tradução automática

Este artigo foi traduzido automaticamente a partir da versão original em inglês.

Um modelo de embedding representa uma entrada como um vetor para pesquisa por semelhança ou outras tarefas posteriores. Um modelo generativo produz uma sequência, como uma resposta ou structured output. Em RAG, um modelo de embedding ajuda a recuperar informação que sustenta a resposta; um gerador utiliza essa informação para responder.

As duas funções podem usar arquiteturas relacionadas, mas os seus objetivos de treino e as suas saídas são diferentes.

Um vetor é uma representação, não uma resposta

PropriedadeModelo de embeddingModelo generativo
Saída habitualVetor com dimensão fixaSequência de tokens de comprimento variável
Exemplo de tarefaEncontrar passagens semelhantes a uma consultaExplicar passagens ou extrair informação delas
AvaliaçãoRelevância e ordenação dos resultados de recuperaçãoCorreção da resposta e utilização da informação que a sustenta

Os modelos de embedding de texto podem agregar representações de tokens de um codificador ou de uma arquitetura derivada de um descodificador. A agregação e o treino das representações tornam o vetor útil; calcular a média de estados ocultos arbitrários não comprova a qualidade da recuperação.

Por exemplo, Qwen3-Embedding-8B é um modelo de embedding de texto com dimensões de saída configuráveis e instruções de tarefa. Siga as convenções do modelo para consultas e documentos. As representações compatíveis não têm de usar prefixos de entrada idênticos.

Mantenha a compatibilidade do índice

Guarde a identidade do codificador, a dimensão e o pré-processamento utilizados para indexar os documentos. As consultas devem usar o codificador de consultas correspondente e as suas instruções. Os vetores de versões de modelos sem relação entre si não devem, em geral, entrar na mesma comparação de semelhança, mesmo que as suas dimensões coincidam.

Mudar o gerador pode deixar o índice vetorial utilizável. Mudar o modelo de embedding exige normalmente recalcular os embeddings dos documentos ou realizar outra migração explicitamente testada.

Alguns modelos permitem encurtar os vetores através do treino Matryoshka. O anúncio da OpenAI sobre embeddings indica que uma representação de 256 dimensões de text-embedding-3-large superou, no MTEB, a representação de 1,536 dimensões de ada-002 usada na comparação. É um benchmark específico desse modelo, não uma prova de que menos dimensões preservam sempre a qualidade.

Para o seu corpus, teste a recuperação com consultas anotadas nas dimensões suportadas. Registe a proporção de documentos relevantes recuperados, a ordenação, o armazenamento e a latência de pesquisa. Um gerador de respostas mais capaz não consegue recuperar de forma fiável uma passagem da fonte que a etapa de recuperação nunca forneceu.

A secção sobre modelos de embedding do guia de engenharia de LLM compara exemplos de modelos e explica o truncamento de dimensões.