Enrutamiento y cascadas de LLM: ¿qué modelo atiende una consulta?
Traducción automática
Este artículo se tradujo automáticamente a partir de la versión original en inglés.
El enrutamiento elige un modelo antes de que genere una respuesta. El procesamiento en cascada empieza con un modelo y recurre a uno más capaz tras evaluar su respuesta. Usa el enrutamiento cuando la consulta aporte información suficiente para elegir de forma fiable. Considera las cascadas cuando comprobar una respuesta terminada proporcione una mejor base para decidir.
Ambos pueden reducir las llamadas a modelos caros. Sus errores y sus costes de latencia son distintos.
¿Cuándo se toma la decisión?
| Enfoque | Información para decidir | Fallo principal | Coste que debe incluirse |
|---|---|---|---|
| Enrutamiento | Características de la consulta y capacidad prevista del modelo | Una consulta difícil se envía a un modelo insuficiente | Enrutador y modelo seleccionado |
| Cascadas | Una respuesta generada y su evaluación | Una respuesta incorrecta supera la comprobación | Modelo inicial, evaluador y llamadas tras el escalado |
Un enrutador podría enviar una pregunta habitual de FAQ a un modelo pequeño y un análisis complejo a uno más capaz. Una cascada podría aceptar una extracción barata solo después de validar sus campos con la fuente y recurrir a un modelo más capaz si la validación falla.
La confianza que declara el modelo que responde no basta para validar la respuesta. Prioriza una comprobación vinculada a la corrección de la tarea, como campos verificados en la fuente o pruebas con cobertura suficiente.
La tabla 6 del artículo de RouteLLM presenta un coste estimado dividido entre 3.66 en su configuración de MT-Bench, con el 95% de su puntuación de calidad de GPT-4. Eso equivale a un coste aproximadamente un 72.7% menor con los precios históricos de los modelos y la configuración de evaluación utilizados. Es evidencia de ese experimento, no una previsión del ahorro actual.
FrugalGPT estudia cascadas sobre un conjunto de modelos. Sus mayores ahorros publicados también dependen de las tareas, los modelos elegidos y la puntuación utilizada para aceptar respuestas.
Mide por separado los errores aceptados
Evalúa casos fáciles y difíciles, incluidas consultas en las que el modelo barato produce una respuesta incorrecta pero plausible. Registra la proporción atendida a bajo coste, las respuestas incorrectas del modelo barato que se aceptan, los escalados, la calidad total y la latencia de extremo a extremo.
En las cascadas, incluye ambas llamadas en las solicitudes que se escalan. En el enrutamiento, incluye la latencia del enrutador y las solicitudes asignadas al modelo equivocado. Compara estos totales con referencias que usen un único modelo y cumplan el requisito de calidad que realmente necesitas.
La sección sobre enrutamiento y cascadas de la LLM Engineering Guide ilustra ambos momentos de decisión.