¿Cómo reducir los costes de los LLM sin perder calidad en las respuestas?

Traducción automática

Este artículo se tradujo automáticamente a partir de la versión original en inglés.

Mida el coste por tarea completada con éxito y después pruebe límites de salida, caché, procesamiento por lotes o modelos más baratos con un conjunto de evaluación reservado. Una factura de tokens menor solo resulta útil si el sistema sigue cumpliendo sus requisitos de calidad y latencia. Empiece por el trabajo repetido o los grupos de peticiones costosos que aparecen en sus datos de uso.

Determine el coste real

Para una API con precios por millón de tokens, el coste simplificado de una petición sin caché es:

cost=input tokens×input price+output tokens×output price106\text{cost} = \frac{\text{input tokens} \times \text{input price} + \text{output tokens} \times \text{output price}}{10^6}

Utilice tarifas actuales, como las de la documentación de precios de OpenAI. Contabilice por separado los precios de las entradas en caché, los cargos por herramientas y los reintentos. Compare la suma de todas las llamadas necesarias para completar una tarea, incluidos el enrutamiento y la validación.

Si aloja el sistema en su propia infraestructura, incluya el tiempo de GPU, la capacidad ociosa, el almacenamiento, la red, las operaciones y la ingeniería. Dividir solo el alquiler de GPU entre los tokens generados puede ocultar costes considerables.

Aplique el cambio al tráfico adecuado

CambioDónde puede ayudarQué verificar
Salidas más cortasRespuestas con detalles innecesariosIntegridad y errores de truncamiento
Caché de prefijosPrefijos de prompts compatibles que se repitenTasa de aciertos, condiciones del proveedor y memoria retenida
Procesamiento por lotesTrabajo que puede esperarPlazo de finalización y gestión de fallos
Enrutamiento de modelosPeticiones que un modelo más barato puede responderPeticiones mal enrutadas, coste del enrutador y calidad de principio a fin
CuantizaciónCombinaciones compatibles de modelo y runtime alojados en infraestructura propiaCalidad, rendimiento, memoria y tamaño de lote utilizable

No elimine pruebas recuperadas solo para acortar un prompt. Compruebe si la falta de contexto aumenta las respuestas incorrectas o los reintentos.

Compare tareas completas

Suponga que una carga de trabajo hipotética envía el 70% de las peticiones a un modelo más barato y el 30% a uno más potente. El coste de sus llamadas a modelos es 0.7 × cheap cost + 0.3 × strong cost, más el enrutamiento, los reintentos y otras llamadas. Son supuestos sobre el tráfico, no una predicción de ahorro.

Ejecute el mismo conjunto de evaluación antes y después del cambio. Informe de los errores de calidad, la latencia, la tasa de finalización y el coste total. RouteLLM ilustra el enrutamiento sujeto a restricciones de calidad en experimentos concretos; su proporción histórica de costes no predice su factura.

Lea el apartado de optimización de costes de la LLM Engineering Guide para conocer las técnicas de serving relacionadas.