Enrutamiento y cascadas de LLM: ¿qué modelo atiende una consulta?

Traducción automática

Este artículo se tradujo automáticamente a partir de la versión original en inglés.

El enrutamiento elige un modelo antes de que genere una respuesta. El procesamiento en cascada empieza con un modelo y recurre a uno más capaz tras evaluar su respuesta. Usa el enrutamiento cuando la consulta aporte información suficiente para elegir de forma fiable. Considera las cascadas cuando comprobar una respuesta terminada proporcione una mejor base para decidir.

Ambos pueden reducir las llamadas a modelos caros. Sus errores y sus costes de latencia son distintos.

¿Cuándo se toma la decisión?

EnfoqueInformación para decidirFallo principalCoste que debe incluirse
EnrutamientoCaracterísticas de la consulta y capacidad prevista del modeloUna consulta difícil se envía a un modelo insuficienteEnrutador y modelo seleccionado
CascadasUna respuesta generada y su evaluaciónUna respuesta incorrecta supera la comprobaciónModelo inicial, evaluador y llamadas tras el escalado

Un enrutador podría enviar una pregunta habitual de FAQ a un modelo pequeño y un análisis complejo a uno más capaz. Una cascada podría aceptar una extracción barata solo después de validar sus campos con la fuente y recurrir a un modelo más capaz si la validación falla.

La confianza que declara el modelo que responde no basta para validar la respuesta. Prioriza una comprobación vinculada a la corrección de la tarea, como campos verificados en la fuente o pruebas con cobertura suficiente.

La tabla 6 del artículo de RouteLLM presenta un coste estimado dividido entre 3.66 en su configuración de MT-Bench, con el 95% de su puntuación de calidad de GPT-4. Eso equivale a un coste aproximadamente un 72.7% menor con los precios históricos de los modelos y la configuración de evaluación utilizados. Es evidencia de ese experimento, no una previsión del ahorro actual.

FrugalGPT estudia cascadas sobre un conjunto de modelos. Sus mayores ahorros publicados también dependen de las tareas, los modelos elegidos y la puntuación utilizada para aceptar respuestas.

Mide por separado los errores aceptados

Evalúa casos fáciles y difíciles, incluidas consultas en las que el modelo barato produce una respuesta incorrecta pero plausible. Registra la proporción atendida a bajo coste, las respuestas incorrectas del modelo barato que se aceptan, los escalados, la calidad total y la latencia de extremo a extremo.

En las cascadas, incluye ambas llamadas en las solicitudes que se escalan. En el enrutamiento, incluye la latencia del enrutador y las solicitudes asignadas al modelo equivocado. Compara estos totales con referencias que usen un único modelo y cumplan el requisito de calidad que realmente necesitas.

La sección sobre enrutamiento y cascadas de la LLM Engineering Guide ilustra ambos momentos de decisión.