Escalado de Chinchilla: ¿Entrenar más reduce el coste de los LLM?

Traducción automática

Este artículo se tradujo automáticamente a partir de la versión original en inglés.

El escalado de Chinchilla estima cómo repartir un presupuesto fijo de cómputo de entrenamiento entre el tamaño del modelo y los tokens de entrenamiento. No minimiza el coste total del modelo durante toda su vida útil en serving. Un modelo más pequeño entrenado durante más tiempo puede costar más al entrenarlo y menos al utilizarlo, si cumple el mismo requisito de calidad.

El volumen previsto de inferencia cambia qué inversión en entrenamiento puede amortizarse.

Qué significa la proporción de 20 tokens

El artículo de Chinchilla entrenó un modelo de 70B parámetros con 1.4 billones de tokens. Eso equivale a 20 tokens de entrenamiento por parámetro. Su análisis de escalado concluyó que el tamaño del modelo y los datos de entrenamiento debían aumentar conjuntamente para aprovechar de forma eficiente el cómputo de entrenamiento bajo los supuestos estudiados.

Considera 20:1 un valor aproximado de ese análisis, no un requisito para cualquier arquitectura, dataset o despliegue. La calidad de los datos, los ejemplos repetidos, los métodos de entrenamiento y la tarea objetivo cambian lo que aportan los tokens adicionales.

El informe de Llama 3 describe el entrenamiento de sus modelos más pequeños con muchos más tokens por parámetro. Esto responde a un objetivo económico distinto: mejorar un modelo más pequeño cuya inferencia puede ejecutarse muchas veces después del entrenamiento. Una proporción mayor no multiplica la calidad ni significa que cada token adicional compense su coste.

Compara el coste total con la calidad requerida

Una estimación útil incluye el entrenamiento, la inferencia prevista y los costes operativos. Supongamos que dos candidatos cumplen el mismo umbral para la tarea:

CandidatoCoste único de entrenamientoCoste de serving por solicitud
Modelo más grande, entrenamiento más cortoMenor en este ejemploMayor
Modelo más pequeño, entrenamiento más largoMayor en este ejemploMenor

El candidato más pequeño recupera el gasto adicional de entrenamiento solo después de suficientes solicitudes. Divide su coste adicional de entrenamiento entre el ahorro por solicitud para estimar ese número de solicitudes. Incluye la evaluación, las actualizaciones del modelo y el trabajo de infraestructura antes de utilizar la estimación para decidir una compra.

Mide la calidad y el coste de serving con la misma distribución de entradas y longitudes de salida. Si el modelo más pequeño necesita reintentos, recurrir a un modelo más potente o salidas más largas, incluye también esos costes.

La sección sobre leyes de escalado de la LLM Engineering Guide compara proporciones publicadas de tokens de entrenamiento por parámetro y distingue los dos objetivos.