Artificial Intelligence i robotika: ORDER testira prilagođavanje modela izmišljenim pravilima

ORDER benchmark koristi potpuno izmišljeni skup fizičkih pravila kako bi proverio da li AI modeli zaista uče novi domen ili se oslanjaju na znanje koje su već imali u trening podacima.

Izmišljeni svet kao test pravog učenja

ORDER kombinuje test od 500 pitanja sa težim ORDER-SPATIAL zadatkom u kojem modeli moraju da poređaju objekte za bezbednu manipulaciju u poznatim i potpuno novim scenama.

Bez prilagođavanja, GPT-4.1 je na ORDER-SPATIAL testu zabeležio Kendall tau od 0,441, što autori tumače kao sukob postojećih pretpostavki modela sa izmišljenom fizikom benchmarka.

Od znanja do izvršivog plana

Nakon continual pre-traininga, manji modeli su se poboljšali i na poznatim i na novim scenama, što autori navode kao dokaz učenja novog world modela umesto pukog memorisanja.

U robot pipeline testu, mali offline modeli posle dodatnog skill prilagođavanja nadmašili su GPT-4.1 čak i kada je GPT-4.1 imao retrieval pristup istim pravilima.

Izvori

Prikazani su izvorni linkovi korišćeni za proveru objavljenih činjenica.

Komentari

Komentari se objavljuju nakon moderacije.

Još nema objavljenih komentara.