Modelos de embedding y modelos generativos: ¿qué produce cada uno?
Traducción automática
Este artículo se tradujo automáticamente a partir de la versión original en inglés.
Un modelo de embedding representa una entrada como un vector para búsquedas por similitud u otras tareas posteriores. Un modelo generativo produce una secuencia, como una respuesta o structured output. En RAG, un modelo de embedding ayuda a recuperar información que respalda la respuesta; el generador la utiliza para responder.
Ambas funciones pueden usar arquitecturas relacionadas, pero sus objetivos de entrenamiento y sus salidas son distintos.
Un vector es una representación, no una respuesta
| Propiedad | Modelo de embedding | Modelo generativo |
|---|---|---|
| Salida habitual | Vector de dimensión fija | Secuencia de tokens de longitud variable |
| Ejemplo de tarea | Encontrar pasajes similares a una consulta | Explicar pasajes o extraer información de ellos |
| Evaluación | Relevancia y ordenación de los resultados de recuperación | Corrección de la respuesta y uso de la información que la respalda |
Los modelos de embedding de texto pueden agregar representaciones de tokens de un codificador o de una arquitectura derivada de un decodificador. La agregación y el entrenamiento de las representaciones hacen útil el vector; promediar estados ocultos arbitrarios no demuestra la calidad de la recuperación.
Por ejemplo, Qwen3-Embedding-8B es un modelo de embedding de texto con dimensiones de salida configurables e instrucciones de tarea. Sigue las convenciones del modelo para consultas y documentos. Las representaciones compatibles no tienen por qué usar prefijos de entrada idénticos.
Mantén la compatibilidad del índice
Guarda la identidad del codificador, la dimensión y el preprocesamiento utilizados para indexar los documentos. Las consultas deben usar el codificador de consultas correspondiente y sus instrucciones. Por lo general, los vectores de versiones de modelos sin relación entre sí no deben incluirse en una misma comparación de similitud, aunque sus dimensiones coincidan.
Cambiar el generador puede dejar el índice vectorial utilizable. Cambiar el modelo de embedding suele exigir volver a calcular los embeddings de los documentos u otra migración probada de forma explícita.
Algunos modelos permiten acortar los vectores mediante entrenamiento Matryoshka. El anuncio de OpenAI sobre embeddings indica que una representación de 256 dimensiones de text-embedding-3-large superó en MTEB a la representación de 1,536 dimensiones de ada-002 utilizada en la comparación. Es un benchmark específico de ese modelo, no una prueba de que reducir las dimensiones siempre preserve la calidad.
Para tu corpus, prueba la recuperación con consultas etiquetadas en las dimensiones admitidas. Registra la exhaustividad de recuperación de documentos relevantes, la ordenación, el almacenamiento y la latencia de búsqueda. Un generador de respuestas más potente no puede recuperar de forma fiable un pasaje de la fuente que la etapa de recuperación nunca proporcionó.
La sección sobre modelos de embedding de la guía de ingeniería de LLM compara ejemplos de modelos y explica el truncamiento de dimensiones.