Policy-Calibrated DAgger bira nivo šuma za imitation learning bez ručnog sweep-a

Novi metod meri raspodelu akcija diffusion policy-ja i closed-loop grešku da bi kalibrisao noise injection za prikupljanje trening podataka pri covariate shift problemu.

Greška se akumulira u zatvorenoj petlji

Autori polaze od problema da politike trenirane imitation learningom vremenom akumuliraju greške i izlaze iz distribucije podataka na kojoj su obučene.

Metod meri raspon akcija diffusion policy-ja duž ekspertske putanje i closed-loop grešku u odnosu na snimljenu trajektoriju.

Kalibracija bez pretrage svih nivoa šuma

Za multimodalni action prostor policy se tokom merenja delimično vodi ka referentnoj trajektoriji, a osobine diffusion modela koriste se da se procenjena greška vrati na skalu kao da vođenja nije bilo.

Eksperimenti uključuju zadatak dosezanja ručice motora u skučenom okruženju, u 3D fotorealističnom simulatoru i 2D planar reacher okruženju.

Autori navode da metod nadmašuje dataset aggregation bez noise-a i dostiže performanse najboljeg noise nivoa poznatog tek naknadno, bez potrebe za sweep-om više nivoa.

Izvori

Prikazani su izvorni linkovi korišćeni za proveru objavljenih činjenica.