Više AI tokova može nadmašiti jedan najbolji, ali izbor odgovora i trošak odlučuju ishod

Autori okvir procenjuju na skupovima ABCD, Schema-Guided Dialogue i HotpotQA.

Ključne činjenice

Dodatna izvršavanja mogu otkriti tačne odgovore koje najbolji pojedinačni workflow propušta, ali troše više računarskih resursa i uvode uverljive distraktore koji otežavaju konačni izbor.

Više pokušaja zato nije besplatno poboljšanje: može povećati pokrivenost, ali istovremeno otežati selekciju.

Problem je formulisan kao izbor portfolija workflow-a u kome se istovremeno određuju broj izvršavanja i raspodela pokušaja između tipova workflow-a.

Time se kvalitet odgovora i računarski trošak optimizuju u istom modelu.

Evaluacija obuhvata različite tipove zadataka kako bi se proverilo ponašanje portfolio pristupa van jednog uskog benchmarka.

Autori proučavaju model u kome se pokreće više izvršavanja različitih workflow-a, a konačni odgovor bira tek nakon uvida u njihove izlaze.

Ključni deo problema zato nije samo koje tokove pokrenuti, već i koliko dobro selektor ume da prepozna najbolji izlaz.

Za konačne skupove workflow-a rad daje egzaktne formulacije, relaksacije linearnog programiranja, postupke nasumičnog zaokruživanja i izračunljive sertifikate performansi.

Autori tako nude više nivoa rešavanja problema, od egzaktne optimizacije do praktičnijih aproksimacija.

Za velike implicitne klase workflow-a autori izvode konačno-dimenzioni dual i elipsoidni metod sa pricing oracle-om koji traži workflow-e sa visokom ponderisanom tačnošću umanjenom za ponavljajući računarski trošak.

Cilj je da se veliki prostor mogućih workflow-a pretražuje bez eksplicitnog nabrajanja svakog kandidata.

Pod slabim uslovom, metod prema radu daje skoro optimalno rešenje relaksacije uz polinomno mnogo poziva oracle-u.

To je teorijska garancija za skaliranje optimizacionog pristupa u većim prostorima workflow-a.

Autori predstavljaju okvir za projektovanje portfolija agentic AI workflow-a kada izbor konačnog odgovora nije savršen i računarski trošak nije zanemarljiv.

Rad posmatra više različitih načina rešavanja istog zadatka kao portfolio iz kojeg sistem na kraju mora da izabere jedan odgovor.

Autori kvalitet selektora sažimaju kroz odds-lift indeks i izvode granice za vrednost raznovrsnosti workflow-a.

U modelu korist od više različitih tokova zavisi i od toga koliko selektor može da iskoristi razlike među njihovim izlazima.

Rad navodi da izbor workflow-a sa najboljim prosečnim rezultatom može biti suboptimalan jer različiti workflow-i mogu uspevati na različitim instancama.

Zbog toga autori ne tretiraju prosečno najbolji tok kao automatski najbolju produkcionu strategiju.

U radu arXiv:2609.18126v1 autori polaze od toga da agentic AI sistemi isti zadatak mogu rešavati kroz različite workflow-e koji se razlikuju po strategiji rezonovanja, strukturi provere i računarskom trošku.

Takve razlike znače da jedan workflow ne mora biti najbolji na svakoj pojedinačnoj instanci.

Izvori

Prikazani su izvorni linkovi korišćeni za proveru objavljenih činjenica.

Komentari

Komentari se objavljuju nakon moderacije.

Još nema objavljenih komentara.