LLM-routing versus cascades: welk model behandelt een vraag?
Automatische vertaling
Dit artikel is automatisch vertaald vanuit de oorspronkelijke Engelse versie.
Routing kiest een model voordat het een antwoord genereert. Een cascade begint met één model en escaleert nadat het antwoord is beoordeeld. Gebruik routing wanneer de vraag genoeg informatie biedt om betrouwbaar te kiezen. Overweeg cascades wanneer controle van een voltooid antwoord een betere basis voor de beslissing geeft.
Beide kunnen het aantal aanroepen van dure models verminderen. Hun fouten en latencykosten verschillen.
Wanneer wordt de beslissing genomen?
| Aanpak | Informatie voor de beslissing | Belangrijkste fout | Mee te nemen kosten |
|---|---|---|---|
| Routing | Kenmerken van de vraag en voorspelde capaciteiten van het model | Een moeilijke vraag gaat naar een ontoereikend model | Router en gekozen model |
| Cascades | Een gegenereerd antwoord en de beoordeling daarvan | Een fout antwoord doorstaat de controle | Eerste model, evaluator en aanroepen na escalatie |
Een router kan een bekende FAQ-vraag naar een klein model sturen en een complexe analyse naar een sterker model. Een cascade kan een goedkope extractie pas accepteren nadat de velden ervan aan de bron zijn getoetst, en escaleren als die controle mislukt.
De zekerheid die het antwoordende model zelf aangeeft, is onvoldoende voor validatie. Geef de voorkeur aan een controle die vaststelt of de taak correct is uitgevoerd, zoals geverifieerde bronvelden of tests met voldoende dekking.
Tabel 6 in het RouteLLM-artikel rapporteert geschatte kosten gedeeld door 3.66 in de gebruikte MT-Bench-opzet, bij 95% van de GPT-4-kwaliteitsscore. Dat komt neer op ongeveer 72.7% lagere kosten bij de toenmalige modelprijzen en evaluatieopzet. Het is bewijs voor dat experiment, geen voorspelling van huidige besparingen.
FrugalGPT onderzoekt cascades binnen een verzameling models. Ook de hoogste gerapporteerde besparingen hangen af van de taken, de gekozen models en de score waarmee antwoorden worden geaccepteerd.
Meet geaccepteerde fouten afzonderlijk
Evalueer eenvoudige en moeilijke gevallen, inclusief vragen waarbij het goedkope model een aannemelijk maar fout antwoord produceert. Leg vast welk deel goedkoop wordt afgehandeld, welke foute antwoorden van het goedkope model worden geaccepteerd, hoeveel escalaties plaatsvinden, wat de totale kwaliteit is en wat de end-to-end-latency is.
Neem bij cascades beide aanroepen mee voor verzoeken die escaleren. Neem bij routing de latency van de router en verkeerd toegewezen verzoeken mee. Vergelijk deze totalen met baselines met één model bij de kwaliteitseis die je daadwerkelijk nodig hebt.
Het onderdeel over routing en cascades in de LLM Engineering Guide laat beide beslismomenten zien.