Routing a kaskady LLM: który model obsługuje zapytanie?

Tłumaczenie automatyczne

Ten artykuł został automatycznie przetłumaczony z angielskiego oryginału.

Routing wybiera model, zanim ten wygeneruje odpowiedź. Kaskada zaczyna od jednego modelu i przechodzi do bardziej zaawansowanego po ocenie jego odpowiedzi. Używaj routingu, gdy zapytanie dostarcza wystarczająco dużo informacji, by dokonać wiarygodnego wyboru. Rozważ kaskadę, gdy sprawdzenie gotowej odpowiedzi daje lepszą podstawę do decyzji.

Oba podejścia mogą ograniczyć wywołania drogich modeli. Różnią się rodzajem błędów i kosztem opóźnień.

Kiedy zapada decyzja?

PodejściePodstawa decyzjiGłówny błądKoszt do uwzględnienia
RoutingCechy zapytania i przewidywane możliwości modeluTrudne zapytanie trafia do niewystarczająco dobrego modeluRouter i wybrany model
KaskadaWygenerowana odpowiedź i jej ewaluacjaBłędna odpowiedź przechodzi weryfikacjęModel początkowy, ewaluator i wywołania po eskalacji

Router może skierować znane pytanie z FAQ do małego modelu, a złożoną analizę do bardziej zaawansowanego. Kaskada może zaakceptować tanią ekstrakcję dopiero po zweryfikowaniu jej pól względem źródła, a w razie niepowodzenia przejść do bardziej zaawansowanego modelu.

Pewność deklarowana przez model udzielający odpowiedzi nie wystarcza do jej walidacji. Wybierz sprawdzenie związane z poprawnością wykonania zadania, takie jak zweryfikowane pola źródłowe lub testy o wystarczającym pokryciu.

Tabela 6 w artykule RouteLLM podaje szacowany koszt podzielony przez 3.66 w zastosowanej konfiguracji MT-Bench, przy 95% wyniku jakości GPT-4. Oznacza to koszt niższy o około 72.7% przy historycznych cenach modeli i zastosowanej konfiguracji ewaluacji. To wynik tego eksperymentu, a nie prognoza obecnych oszczędności.

FrugalGPT bada kaskady w obrębie zestawu modeli. Najwyższe raportowane oszczędności również zależą od zadań, wybranych modeli i punktacji decydującej o akceptacji odpowiedzi.

Mierz zaakceptowane błędy osobno

Oceniaj łatwe i trudne przypadki, w tym zapytania, dla których tani model tworzy wiarygodną, ale błędną odpowiedź. Rejestruj odsetek zapytań obsłużonych tanio, zaakceptowane błędne odpowiedzi taniego modelu, eskalacje, ogólną jakość i opóźnienie całego procesu.

W przypadku kaskad uwzględnij oba wywołania dla eskalowanych żądań. W przypadku routingu uwzględnij opóźnienie routera i żądania skierowane do niewłaściwego modelu. Porównaj te wartości z wariantami bazowymi używającymi jednego modelu przy wymaganym przez ciebie poziomie jakości.

Sekcja o routingu i kaskadach w LLM Engineering Guide pokazuje oba momenty podejmowania decyzji.