Studija ispituje kako da se spreči „task collapse“ pri online RL prilagođavanju robota

Istraživači su analizirali problem u kojem online reinforcement learning tokom fine-tuninga vision-language-action politika može da pogorša prethodno naučene zadatke. U eksperimentima na LIBERO-10, uncertainty-gated kontroler smanjio je pojavu task collapse-a u poređenju sa fiksnim i naučenim exploration-noise pristupom, ali nijedna varijanta u datom budžetu nije nadmašila behavior-cloning osnovu.

Problem očuvanja već naučenih zadataka

Rad proučava failure mode koji autori nazivaju task collapse: tokom online reinforcement learning fine-tuninga robotska politika može da izgubi sposobnost da pouzdano izvršava neke zadatke koje je prethodno naučila. Eksperimenti su sprovedeni na LIBERO-10 uz isti mali compute budžet za poređene pristupe.

U testovima je korišćena SmolVLA politika sa 450 miliona parametara, trenirana PPO metodom uz stochastic odnosno SDE sampling. Time su autori pokušali da poređenje različitih exploration strategija zadrže pod istim eksperimentalnim uslovima.

Tri pristupa exploration noise-u

Poređene su tri politike exploration noise-a. Prva koristi fiksnu skalu šuma, druga koristi naučenu noise mrežu u stilu ReinFlow pristupa, dok treća koristi uncertainty-gated kontroler koji raspoređuje exploration između različitih tokova zadataka na osnovu signala novine i procenjene kompetencije, bez oznaka zadataka i bez granica epizoda.

Rezultati pokazuju da je sa fiksnim noise-om do task collapse-a došlo u dva od tri seed-a, dok je naučeni noise pristup kolabirao u svakom seed-u koji je meren do iteracije 200. Uncertainty-gated kontroler nije zabeležio task collapse ni u jednom od tri seed-a.

Smanjenje fiksne skale šuma usporilo je pad performansi, ali ga nije potpuno zaustavilo. To sugeriše da samo smanjivanje exploration intenziteta nije bilo dovoljno da reši problem očuvanja zadataka u ovom eksperimentalnom okviru.

Šta se dešavalo sa parametrima modela

Merenje pomeranja parametara pokazalo je da se action-expert deo modela kod uncertainty-gated kontrolera i dalje menjao tokom učenja. Istovremeno, prosečan primenjeni noise bio je blizu fiksnoj skali u dostupnim logovima, što ukazuje da rezultat nije jednostavno posledica toga što je kontroler koristio znatno manje exploration šuma.

Autori navode i dva dodatna opažanja iz režima treninga, ali ih ne predstavljaju kao dokaz uzročnosti: u bfloat16 režimu bez fp32 master kopije veliki deo elemenata action-expert komponente ostao je bit-identičan kroz tri uzastopne iteracije, dok je jedan fp32-master eksperiment pri referentnoj learning-rate vrednosti doveo do kolapsa obe ruke u single-seed posmatranju.

Važno ograničenje rezultata

Iako je uncertainty-gated kontroler bolje očuvao zadatke u ovom poređenju, nijedna eksperimentalna grana nije poboljšala rezultat u odnosu na behavior-cloning baseline u korišćenom compute budžetu. Zbog toga nalaz ne znači da je online RL u ovom eksperimentu dao ukupno bolju politiku, već da je određena exploration strategija bolje sprečila degradaciju prethodno naučenih zadataka.

Izvori

Prikazani su izvorni linkovi korišćeni za proveru objavljenih činjenica.

Komentari

Komentari se objavljuju nakon moderacije.

Još nema objavljenih komentara.