TEMPO daje robotima „sećanje“ na kretanje i podiže uspeh dinamičke manipulacije

Novi rad tvrdi da veliki vision-language-action modeli ne zapinju samo zbog veličine modela, već zato što pri odlučivanju često vide samo jedan trenutak scene i gube informaciju o kretanju i prethodnom stanju.

Jedan kadar nije dovoljan za svet koji se kreće

Vision-language-action modeli pokazali su dobre rezultate u relativno statičnim zadacima manipulacije, ali u dinamičkim scenama često imaju problem jer odluku donose iz jedne trenutne opservacije. Autori rada TEMPO identifikuju dva reprezentaciona problema koja, po njihovom tumačenju, ostaju prisutna čak i kada se poveća model ili smanji latencija inferencije.

Prvi problem je nejasnoća kretanja: pojedinačna slika ne pokazuje dinamiku scene i zato ne daje dovoljno informacija da se pouzdano predvidi budući položaj objekta koji se kreće. Drugi je state aliasing, kada dve vizuelno slične slike pripadaju različitim trenucima istog zadatka i zahtevaju različitu akciju robota.

Dva temporalna signala umesto jednog kadra

TEMPO pokušava da reši oba problema bez menjanja osnovnog pretrained VLA modela. Sistem mu dodaje dva vremenska ulaza: sažetak kretanja dobijen iz zamrznutog video foundation modela, koji treba da razreši nejasnoću kretanja, i kratku istoriju proprioceptivnih podataka robota, koja pomaže da se razlikuju slične slike iz različitih faza zadatka.

Autori naglašavaju da TEMPO ne zahteva promenu backbone modela i da uvodi mali dodatni računarski trošak tokom treninga i primene. To je važno jer predlog nije zamišljen kao potpuno nova robotska arhitektura, već kao dodatak postojećem VLA sistemu koji mu vraća deo temporalnog konteksta izgubljenog pri radu sa pojedinačnim kadrom.

Bottle Handover sa 44 na 74 odsto

U četiri dinamička zadatka manipulacije TEMPO je poboljšao rezultate u odnosu na osnovni pristup. Najkonkretniji broj iz rada odnosi se na Bottle Handover, gde je stopa uspeha porasla sa 44 na 74 odsto. Autori takođe navode da je TEMPO bio jedini testirani metod koji je rešio njihov state-aliasing zadatak.

Ablation i probing testovi, prema radu, podržavaju ideju da dva temporalna signala imaju različite uloge: svaki od njih nezavisno ublažava problem za koji je uveden. To je bitno jer rezultat ne zavisi samo od dodavanja još ulaza modelu, već sugeriše da motion summary i proprioceptivna istorija ciljaju dve različite vrste greške.

TEMPO-Bench sa više od 50.000 anotiranih frejmova

Pored samog modela, istraživači objavljuju i TEMPO-Bench, benchmark sa više od 50.000 anotiranih frejmova za procenu percepcije kretanja kod robota. Evaluacija je organizovana u regresionom i multiple-choice formatu, što omogućava da se odvojeno proverava koliko model razume dinamiku scene pre nego što se uspeh meri kroz ceo manipulacioni zadatak.

To čini rad zanimljivim i izvan jednog konkretnog sistema. Ako je osnovna tvrdnja tačna — da deo grešaka dolazi iz nedostatka temporalnog konteksta, a ne samo iz premalog modela — onda benchmark može da pomogne da se budući VLA sistemi porede upravo po tome koliko dobro koriste informaciju o kretanju i istoriji stanja.

Više modela nije isto što i više konteksta

Glavna poruka rada je da kod dinamičke manipulacije problem možda nije dovoljno opisati kao pitanje model-skale. Veći model i brža inferencija ne vraćaju automatski informaciju koja nije prisutna u ulazu. TEMPO zato pokušava da robotu doda ono što pojedinačna slika nema: kratku informaciju o tome kako se scena kretala i u kom se unutrašnjem stanju robot nalazio neposredno pre odluke. Time se fokus sa same veličine modela pomera na kvalitet vremenskog konteksta koji model dobija pre akcije.

Izvori

Prikazani su izvorni linkovi korišćeni za proveru objavljenih činjenica.

Komentari

Komentari se objavljuju nakon moderacije.

Još nema objavljenih komentara.