StarWM pokušava da nauči world model šta da rekonstruiše, a šta da ignoriše
Novi rad predstavlja world model koji attention mehanizmom bira vizuelne regione važne za dinamiku, umesto da jednako rekonstruiše sav sadržaj u kadru.

Problem rekonstrukcije svega što se vidi
Autori navode da world modeli zasnovani na rekonstrukciji mogu trošiti reprezentacioni kapacitet prema površini piksela, pa vizuelni detalji nevažni za dinamiku mogu da dominiraju učenjem.
StarWM koristi self-supervised attention routing da odredi gde rekonstrukcija treba da se primeni, dok dual-stream decoder ograničava rekonstrukciju na odabrane regione i stop-gradient barijere razdvajaju ciljeve treninga.
Otporniji na vizuelne distraktore
Na DeepMind Control testovima sa dinamičkim video pozadinama, reward-free StarWM je prema autorima imao najbolje rezultate pri random-frame distraktorima i znatno nadmašio rekonstrukcione baseline modele na sekvencijalnom videu.
Mehanističko sondiranje pokazalo je da model kroz dugu imaginaciju gotovo savršeno čuva atribute stanja dok sistematski odbacuje distraktore.
Reward-augmented varijanta je u sekvencijalnom videu dostigla ili nadmašila rekonstrukciono-slobodne metode i ostvarila najveći ukupni return kroz sve režime distraktora.
Izvori
Prikazani su izvorni linkovi korišćeni za proveru objavljenih činjenica.
