Policy-Calibrated DAgger bira nivo šuma za imitation learning bez ručnog sweep-a
Novi metod meri raspodelu akcija diffusion policy-ja i closed-loop grešku da bi kalibrisao noise injection za prikupljanje trening podataka pri covariate shift problemu.

Greška se akumulira u zatvorenoj petlji
Autori polaze od problema da politike trenirane imitation learningom vremenom akumuliraju greške i izlaze iz distribucije podataka na kojoj su obučene.
Metod meri raspon akcija diffusion policy-ja duž ekspertske putanje i closed-loop grešku u odnosu na snimljenu trajektoriju.
Kalibracija bez pretrage svih nivoa šuma
Za multimodalni action prostor policy se tokom merenja delimično vodi ka referentnoj trajektoriji, a osobine diffusion modela koriste se da se procenjena greška vrati na skalu kao da vođenja nije bilo.
Eksperimenti uključuju zadatak dosezanja ručice motora u skučenom okruženju, u 3D fotorealističnom simulatoru i 2D planar reacher okruženju.
Autori navode da metod nadmašuje dataset aggregation bez noise-a i dostiže performanse najboljeg noise nivoa poznatog tek naknadno, bez potrebe za sweep-om više nivoa.
Izvori
Prikazani su izvorni linkovi korišćeni za proveru objavljenih činjenica.
