Novi pristup trenira rojeve dronova jeftinije tako što skupu fiziku koristi samo za kalibraciju

Istraživači predlažu mixed-fidelity metod za kooperativne rojeve dronova: politika se trenira u jeftinom low-fidelity simulatoru, dok se high-fidelity fizika koristi samo za kratku jednokratnu kalibraciju rezidualnog modela.

High-fidelity trening postaje sve skuplji kako roj raste

Treniranje politika za više dronova direktno u high-fidelity simulatorima daje realističniju fiziku, ali trošak brzo raste sa brojem letelica. Svaki dodatni agent povećava složenost rešavanja kontakata i interakcija, a u simulaciji raste i broj padova, što dodatno usporava učenje. Rad „Calibrate Once, Fly Any Team“ pokušava da zadrži deo realističnosti bez stalnog high-fidelity reinforcement learninga.

Predlog je mixed-fidelity pristup u kojem se reinforcement learning potpuno premešta u jednostavniji point-mass simulator. Time se najskuplji deo procesa obavlja u modelu koji je znatno jeftiniji za izvođenje i može lakše da skalira kada broj dronova poraste.

Low-fidelity simulator se ispravlja rezidualnim modelom

Sama low-fidelity simulacija nije dovoljna jer pojednostavljeni model ne hvata sve efekte realističnije dinamike. Zato autori dodaju mali bagged residual ensemble po agentu. Taj model se fituje jednom, offline, koristeći kratke kalibracione letove u high-fidelity simulatoru.

Važan detalj je da kalibracija zahteva samo jedan izolovani dron. Zbog toga trošak prikupljanja podataka za korekciju ne raste zajedno sa veličinom tima. Kada se jednom nauči rezidualna razlika između jeftinog i detaljnijeg modela, ista korekcija može da se koristi dok se politika trenira za veće timove.

Jedna deljena decentralizovana politika za sve agente

Politika se optimizuje kao jedna deljena, decentralizovana politika unutar potpuno diferencijabilnog JAX-native low-fidelity point-mass simulatora. To znači da agenti dele isti naučeni kontroler, ali odluke donose lokalno, što je uobičajen način da se izbegne centralizovani kontroler koji bi postao usko grlo pri većem broju dronova.

Referentne putanje nastaju izvođenjem postojeće politike trenirane samo u low-fidelity okruženju, a zatim se prate u high-fidelity simulatoru pomoću PD kontrolera bez dodatnog treninga. Time autori dobijaju signal koliko pojednostavljeni model greši u odnosu na detaljniju dinamiku, bez potrebe da ponovo treniraju celu politiku u skupljem okruženju.

Bolji od čistog low-fidelity pristupa u svim testiranim kombinacijama

Metod je evaluiran na četiri kooperativna zadatka sa timovima od 3 do 18 dronova. Rezidualno korigovana politika nadmašila je nekorigovani low-fidelity baseline u svim kombinacijama zadatka i veličine tima, a politiku treniranu od nule u high-fidelity simulatoru pobedila je u 22 od 24 testirane kombinacije.

U poređenju sa politikom koja je dodatno fino podešena u high-fidelity simulatoru, mixed-fidelity pristup ipak zaostaje. Međutim, autori navode da se ta razlika postepeno smanjuje kako tim postaje veći, što je upravo oblast u kojoj direktni high-fidelity trening postaje najskuplji.

Cilj nije samo tačnost nego skaliranje bez eksplozije troška

Na najvećim veličinama tima predloženi metod dostiže gotovo ekvivalentne performanse uz samo deo računarskog troška. Istovremeno potpuno izbegava visoke stope padova tipične za reinforcement learning direktno u high-fidelity simulatoru. To je centralna praktična prednost rada: skupi detaljni model koristi se za kalibraciju, a ne za svaki korak optimizacije.

Takva podela rada je posebno zanimljiva za rojeve jer se najveći deo troška pojavljuje upravo kada broj agenata raste. Ako korekcija naučena na jednom dronu može dovoljno dobro da popravi pojednostavljenu dinamiku za veće timove, tada se cena pripreme politike više ne povećava istim tempom kao u potpuno high-fidelity treningu.

Rezultat je obećavajući, ali ostaje simulacioni test

Rezultati za sada pokazuju ponašanje kroz konkretne simulatore, zadatke i veličine timova, pa ne dokazuju da će isti nivo prenosa ostati kada se politika prebaci na stvarne letelice, drugačije senzore ili jače poremećaje. Posebno će biti važno proveriti koliko rezidualni model ostaje validan kada fizički uslovi odstupaju od kalibracionih letova.

Ipak, rad pokazuje jasan pravac: za kooperativne robotičke sisteme možda nije neophodno birati između potpuno jeftine ali grube simulacije i potpuno realistične ali skupe. Kombinovanje kratke high-fidelity kalibracije sa masovnim low-fidelity treningom može da ponudi srednji put koji postaje sve vredniji kako broj agenata raste.

Izvori

Prikazani su izvorni linkovi korišćeni za proveru objavljenih činjenica.

Komentari

Komentari se objavljuju nakon moderacije.

Još nema objavljenih komentara.