Algoritam bira najbolji LLM uz istovremeno računanje različitih troškova upita

Novi rad formuliše izbor najboljeg modela kao cost-aware multi-armed bandit problem sa pairwise poređenjima odgovora i različitim cenama pozivanja pojedinačnih LLM-ova.

Pairwise poređenja umesto jednog apsolutnog skora

Autori problem izbora najboljeg modela formulišu kao varijantu multi-armed bandit pristupa u kojoj se modeli porede kroz dueling feedback, odnosno parna poređenja odgovora.

Model uključuje i heterogene troškove uzorkovanja kako bi odrazio činjenicu da različiti LLM-ovi imaju različitu cenu po upitu.

Pod pretpostavkom postojanja Condorcet pobednika, autori predlažu Track-and-Stop stil algoritma za identifikaciju najboljeg modela uz zadatu pouzdanost.

Cilj je minimalan trošak do pouzdane odluke

Autori dokazuju da algoritam skoro sigurno dostiže asimptotski optimalan trošak kako dozvoljena verovatnoća greške teži nuli.

U eksperimentima na sintetičkim i realnim instancama rad navodi konzistentna poboljšanja u odnosu na klasične cost-unaware algoritme i njihove cost-aware proširenja.

Izvori

Prikazani su izvorni linkovi korišćeni za proveru objavljenih činjenica.