MVAgent pokušava da održi likove i prostor doslednim kroz više video kadrova
Preprint predstavlja multi-agent sistem za generisanje video sekvenci koji gradi dosledne uslove za svaki kadar i koristi shot-level reinforcement learning da smanji vizuelno i narativno odstupanje između scena.

Svaki kadar dobija strukturisane uslove
Autori navode da odvojeni zahtevi ka zamrznutom video generatoru ne garantuju isti izgled lika, stabilan raspored prostora ili kontinuitet stanja između kadrova.
MVAgent problem preformuliše kao konstrukciju uslova, pri čemu više agenata sarađuje kroz tipizirane conditioning ulaze koje orkestrator sastavlja za svaki zahtev.
Observer beleži kako se svaki kadar završava i čuva kontinuitet, a Transition agent iz tog zapisa gradi reference za akciju lika i prostor u sledećem kadru.
Optimizacija na nivou kadra
Pošto se efekat zahteva vidi tek nakon renderovanja, sistem koristi Trunk-GDPO koji poredi kandidatske rezultate na svakom kadru i nastavlja najbolji kao osnovu za sledeći korak.
Autori navode da je MVAgent na ViMax-Bench testu ostvario najveću cross-shot doslednost i kvalitet narativnog planiranja među poređenim metodama i da je u ljudskoj evaluaciji bio preferiran u odnosu na najjači agentni baseline.
Izvori
Prikazani su izvorni linkovi korišćeni za proveru objavljenih činjenica.
