Studija ispituje streaming reinforcement learning za adaptivno učenje robota
Novi rad analizira da li roboti mogu da se prilagođavaju nepredviđenim promenama koristeći kontinuirani tok iskustva umesto klasičnog batch treninga. Najbolji rezultati zabeleženi su u kvadrupednoj lokomociji, dok su eksperimenti sa manipulacijom pokazali više ograničenja.

Problem: robot se menja posle treninga
Rad polazi od problema da robot tokom dugog perioda rada može da naiđe na scenarije koji nisu postojali u početnom skupu za trening, što može da dovede do pada performansi.
Jedan uobičajeni pristup je širenje offline skupa podataka u nadi da će politika robota unapred postati dovoljno robusna, ali autori ispituju alternativu u kojoj se sistem prilagođava tokom rada koristeći najnoviji tok iskustva.
Streaming deep RL kao continual-learning okvir
Autori navode da prethodni radovi jesu pokazali da je moguće koristiti stream-based deep reinforcement learning, gde se ažuriranja zasnivaju samo na najnovijem iskustvu, ali da takav pristup još nije bio ubedljivo prikazan kao continual-learning okvir za prilagođavanje robotskih politika nepoznatim promenama.
U radu se pokazuje da posle početne faze pretreninga streaming deep RL može da omogući robotu da se prilagodi neočekivanim promenama sopstvenog stanja, okruženja ili ciljeva.
Najbolji rezultati u kvadrupednoj lokomociji
Glavni eksperimenti u kvadrupednoj lokomociji pokazali su da robotska politika zasnovana na dubokoj neuronskoj mreži, uz određene optimizatore i tehnike za ublažavanje gubitka plastičnosti, može brzo da se prilagodi različitim promenama koristeći znanje iz pretreninga.
Autori navode da je u tim eksperimentima streaming pristup nadmašio batch-based on-policy metode i povećao stopu uspeha zadataka do 90 odsto u odnosu na početnu pretreniranu politiku.
Manipulacija je teži test
Istraživači su dodatno testirali robotske manipulacione zadatke kako bi proverili da li se isti zaključci prenose na drugačije morfologije i scenarije.
Rezultati pokazuju da se deo uspeha iz kvadrupedne lokomocije može preneti na manipulaciju, ali uz ograničenja u stabilnosti i performansama. Autori zato završavaju rad diskusijom o ograničenjima i posledicama za budući continual learning kod robota.
Izvori
Prikazani su izvorni linkovi korišćeni za proveru objavljenih činjenica.

Komentari
Komentari se objavljuju nakon moderacije.
Još nema objavljenih komentara.