Acting in Meters dodaje metričke odnose modelima za preciznu robotsku manipulaciju
Istraživači predlažu okvir koji robotskim modelima eksplicitno daje metričke odnose između akcije, objekta i geometrije scene, umesto da ih ostavi implicitnim.

Semantika nije dovoljna
Vision-Language-Action i World-Action modeli unapredili su robotsku manipulaciju vođenu jezikom, ali autori rada navode da odnosi između akcija, objekata i geometrije scene često ostaju implicitni.
Polazeći od načina na koji čovek kombinuje razumevanje relevantnih objekata sa prostornom povratnom informacijom, rad uvodi metrički okvir koji modelira odnose na nivou objekta i cele scene u zajedničkoj fizičkoj skali.
Objekat i scena
Interaction-Centric Tokens predstavljaju putanju poze završnog efektora u odnosu na objekat kojim se manipuliše, dok Metric Action Interaction Field koristi karakteristike oblaka tačaka scene da nauči korekcije akcije uslovljene geometrijom.
Prijavljena poboljšanja
Autori prijavljuju prosečna poboljšanja uspešnosti od 0,80 i 3,59 procentnih poena na LIBERO i RoboTwin 2.0 testovima, kao i 6,80 poena na realnim zadacima i 7,45 poena na njihovim out-of-distribution varijantama.
Okvir se, prema radu, može dodati različitim VLA i WAM osnovama kroz dvostepenu adaptaciju sa relativno malim brojem dodatnih parametara i koraka treniranja.
Izvori
Prikazani su izvorni linkovi korišćeni za proveru objavljenih činjenica.

Komentari
Komentari se objavljuju nakon moderacije.
Još nema objavljenih komentara.