¿Cómo reducir los costes de los LLM sin perder calidad en las respuestas?
Traducción automática
Este artículo se tradujo automáticamente a partir de la versión original en inglés.
Mida el coste por tarea completada con éxito y después pruebe límites de salida, caché, procesamiento por lotes o modelos más baratos con un conjunto de evaluación reservado. Una factura de tokens menor solo resulta útil si el sistema sigue cumpliendo sus requisitos de calidad y latencia. Empiece por el trabajo repetido o los grupos de peticiones costosos que aparecen en sus datos de uso.
Determine el coste real
Para una API con precios por millón de tokens, el coste simplificado de una petición sin caché es:
Utilice tarifas actuales, como las de la documentación de precios de OpenAI. Contabilice por separado los precios de las entradas en caché, los cargos por herramientas y los reintentos. Compare la suma de todas las llamadas necesarias para completar una tarea, incluidos el enrutamiento y la validación.
Si aloja el sistema en su propia infraestructura, incluya el tiempo de GPU, la capacidad ociosa, el almacenamiento, la red, las operaciones y la ingeniería. Dividir solo el alquiler de GPU entre los tokens generados puede ocultar costes considerables.
Aplique el cambio al tráfico adecuado
| Cambio | Dónde puede ayudar | Qué verificar |
|---|---|---|
| Salidas más cortas | Respuestas con detalles innecesarios | Integridad y errores de truncamiento |
| Caché de prefijos | Prefijos de prompts compatibles que se repiten | Tasa de aciertos, condiciones del proveedor y memoria retenida |
| Procesamiento por lotes | Trabajo que puede esperar | Plazo de finalización y gestión de fallos |
| Enrutamiento de modelos | Peticiones que un modelo más barato puede responder | Peticiones mal enrutadas, coste del enrutador y calidad de principio a fin |
| Cuantización | Combinaciones compatibles de modelo y runtime alojados en infraestructura propia | Calidad, rendimiento, memoria y tamaño de lote utilizable |
No elimine pruebas recuperadas solo para acortar un prompt. Compruebe si la falta de contexto aumenta las respuestas incorrectas o los reintentos.
Compare tareas completas
Suponga que una carga de trabajo hipotética envía el 70% de las peticiones a un modelo más barato y el 30% a uno más potente. El coste de sus llamadas a modelos es 0.7 × cheap cost + 0.3 × strong cost, más el enrutamiento, los reintentos y otras llamadas. Son supuestos sobre el tráfico, no una predicción de ahorro.
Ejecute el mismo conjunto de evaluación antes y después del cambio. Informe de los errores de calidad, la latencia, la tasa de finalización y el coste total. RouteLLM ilustra el enrutamiento sujeto a restricciones de calidad en experimentos concretos; su proporción histórica de costes no predice su factura.
Lea el apartado de optimización de costes de la LLM Engineering Guide para conocer las técnicas de serving relacionadas.