LLM Routing vs. Cascading: Welches Model bearbeitet eine Anfrage?

Automatische Übersetzung

Dieser Artikel wurde automatisch aus der englischen Originalversion übersetzt.

Routing wählt ein Model aus, bevor es eine Antwort generiert. Cascading beginnt mit einem Model und eskaliert nach der Bewertung seiner Antwort. Nutzen Sie Routing, wenn die Anfrage genügend Informationen für eine zuverlässige Auswahl liefert. Ziehen Sie Cascading in Betracht, wenn die Prüfung einer fertigen Antwort eine bessere Entscheidungsgrundlage bietet.

Beide Ansätze können Aufrufe teurer Models reduzieren. Ihre Fehler und die zusätzliche Latency unterscheiden sich.

Wann fällt die Entscheidung?

AnsatzEntscheidungsgrundlageHauptfehlerEinzurechnende Kosten
RoutingMerkmale der Anfrage und vorhergesagte Fähigkeiten des ModelsEine schwierige Anfrage geht an ein unzureichendes ModelRouter und ausgewähltes Model
CascadingEine generierte Antwort und ihre BewertungEine falsche Antwort besteht die PrüfungErstes Model, Evaluator und Aufrufe nach der Eskalation

Ein Router könnte eine bekannte FAQ-Frage an ein kleines Model und eine komplexe Analyse an ein leistungsfähigeres Model senden. Eine Cascade könnte eine günstige Extraktion erst akzeptieren, nachdem ihre Felder anhand der Quelle validiert wurden, und bei fehlgeschlagener Prüfung eskalieren.

Die vom antwortenden Model angegebene Sicherheit reicht zur Validierung nicht aus. Bevorzugen Sie eine Prüfung, die sich auf die korrekte Erfüllung der Aufgabe bezieht, etwa verifizierte Quellfelder oder Tests mit ausreichender Abdeckung.

Tabelle 6 des RouteLLM-Papers berichtet für dessen MT-Bench-Konfiguration geschätzte Kosten, die durch 3.66 geteilt wurden, bei 95% seines GPT-4-Qualitätswerts. Das entspricht etwa 72.7% niedrigeren Kosten unter den damaligen Model-Preisen und Bewertungsbedingungen. Es ist ein Beleg für dieses Experiment, keine Prognose aktueller Einsparungen.

FrugalGPT untersucht Cascades innerhalb einer Gruppe von Models. Auch die höchsten berichteten Einsparungen hängen von den Aufgaben, der Model-Auswahl und der Bewertung für die Annahme einer Antwort ab.

Akzeptierte Fehler separat messen

Bewerten Sie einfache und schwierige Fälle, einschließlich Anfragen, bei denen das günstige Model eine plausible, aber falsche Antwort erzeugt. Erfassen Sie den günstig bearbeiteten Anteil, akzeptierte falsche Antworten günstiger Models, Eskalationen, Gesamtqualität und End-to-End-Latency.

Rechnen Sie bei Cascades für eskalierte Anfragen beide Aufrufe ein. Berücksichtigen Sie beim Routing die Latency des Routers und falsch zugeordnete Anfragen. Vergleichen Sie diese Gesamtwerte mit Baselines mit einem einzigen Model unter der Qualitätsanforderung, die Sie tatsächlich benötigen.

Der Abschnitt zu Routing und Cascading im LLM Engineering Guide veranschaulicht beide Entscheidungszeitpunkte.