Fine-tuning vs RAG vs prompting: ¿cuál deberías usar?
Traducción automática Este artículo se tradujo automáticamente a partir de la versión original en inglés.
Usa prompting para aclarar la tarea, retrieval-augmented generation (RAG) para aportar conocimiento actual o privado, y fine-tuning para cambiar comportamientos repetibles del modelo. Estas técnicas resuelven problemas distintos y a menudo forman parte del mismo sistema.
Empieza con una baseline de prompting medida. Añade RAG cuando las respuestas necesiten evidencia externa o datos que cambien con frecuencia. Aplica fine-tuning cuando los fallos restantes sean comportamientos estables, como el formato, el tono, los límites de clasificación, el tool use o el lenguaje del dominio, y existan suficientes ejemplos revisados.
Última revisión: 2026-08-10. La decisión prioriza el tipo de fallo, las necesidades de evidencia, la calidad de los datos, la frecuencia de actualización, la latencia, el coste operativo y la capacidad de evaluar regresiones.
Tabla de decisión
| Problema | Primera intervención | Motivo |
|---|---|---|
| Las instrucciones no están claras o faltan ejemplos | Prompting | Es la forma más rápida de comprobar si el modelo base ya tiene esa capacidad. |
| Los datos son privados, deben citarse o cambian a menudo | RAG | La recuperación actualiza el conocimiento sin reentrenamiento y puede conservar la procedencia de las fuentes. |
| El comportamiento de salida es sistemáticamente incorrecto | Fine-tuning | Los ejemplos revisados pueden enseñar un formato, estilo, etiquetas o comportamiento de las herramientas estables. |
| El modelo carece de la capacidad subyacente | Cambiar el modelo o el diseño del sistema | Prompting y fine-tuning no pueden crear de forma fiable una capacidad inexistente. |
| Las respuestas necesitan datos actuales y un comportamiento especializado | RAG más fine-tuning | La recuperación aporta evidencia, mientras que el ajuste cambia cómo la utiliza el modelo. |
Usa prompting primero
Prompting es el diagnóstico más barato. Define la tarea, el contrato de salida, los ejemplos, las herramientas permitidas y las condiciones de rechazo. Crea un conjunto de evaluación pequeño antes de añadir más infraestructura. Si un prompt mejorado corrige los fallos representativos, detente ahí.
Prompting se vuelve frágil cuando el prompt contiene una base de conocimiento extensa, excepciones repetidas o demostraciones largas. Es una señal para trasladar el conocimiento a retrieval o el comportamiento a los datos de entrenamiento, no para seguir ampliando un único bloque de instrucciones.
Usa RAG para el conocimiento y la procedencia
RAG encaja con manuales de producto, políticas, documentos internos, acontecimientos recientes y cualquier respuesta que deba citar una fuente. Su calidad depende del parsing, el chunking, la recuperación, el ranking, los permisos y la compatibilidad con citas. Un generador más grande no puede recuperar una evidencia que la recuperación haya omitido.
RAG no es un método de entrenamiento de comportamiento. Puede mostrar al modelo un ejemplo o una regla, pero no hace que ese comportamiento sea estable en todas las solicitudes.
Usa fine-tuning para comportamientos repetibles
Fine-tuning encaja con la clasificación, el estilo de extracción, la estructura de las respuestas, la terminología del dominio y los patrones recurrentes de tool use. Requiere datos de entrenamiento revisados, un conjunto de evaluación reservado, versionado de artefactos y una vía de rollback. No hagas fine-tuning sobre datos que cambian a menudo si retrieval puede proporcionarlos en el momento de la solicitud.
Una secuencia práctica
- Define el éxito y crea un conjunto de evaluación representativo.
- Establece una baseline basada únicamente en prompting con el modelo más potente que sea aceptable.
- Añade RAG si los fallos se deben a evidencias ausentes o cambiantes.
- Recopila y revisa ejemplos de los fallos estables que persistan.
- Aplica fine-tuning solo si la mejora de calidad, latencia o coste compensa los datos y las operaciones adicionales del modelo.
- Vuelve a ejecutar la misma evaluación después de cada cambio en el prompt, el índice, el modelo o el adapter.
Lecturas recomendadas
- Fine-tuning de LLMs aborda los datos, LoRA, la evaluación y el despliegue.
- Métricas de evaluación de RAG muestra cómo localizar fallos por etapa del pipeline.
- Context Engineering para AI Agents aborda el contexto de runtime que rodea a los prompts y la recuperación.