BrainFocus koristi EEG da usmeri AI pogled na važan deo slike i smanji računarski trošak

Novi istraživački okvir kombinuje EEG signal, detekciju objekata i vision-language model kako bi u složenim scenama obradio samo relevantni region kada je procena dovoljno sigurna.

EEG kao dodatni signal za vision-language modele

Vision-language modeli postižu dobre rezultate u vizuelnom odgovaranju na pitanja, ali obrada velikih i pretrpanih slika može biti skupa kada je za odgovor važan samo mali deo scene. Rad BrainFocus polazi od ideje da EEG signal, koji beleži neuralni odgovor čoveka na vizuelni stimulus, može da posluži kao dodatni semantički trag o tome koji deo slike je relevantan.

Autori pritom ne pretpostavljaju da je EEG dekodiranje nepogrešivo. Naprotiv, u radu eksplicitno navode da je prepoznavanje vizuelne kategorije iz EEG-a i dalje nesavršeno, pa direktno rutiranje modela samo na osnovu tog signala može da bude nepouzdano. Zato BrainFocus uvodi dodatni sloj provere pre nego što odluči da li će vision-language model dobiti isečen region ili celu sliku.

EEG bira kategoriju, YOLO nalazi region

U predloženom toku EEG klasifikator najpre predviđa ciljnu kategoriju, dok YOLO detektor zatim pokušava da pronađe odgovarajući region interesa na slici. Tek kada obe procene pređu zadate pragove pouzdanosti, vision-language model dobija samo isečeni region. Ako jedan od ta dva uslova nije ispunjen, sistem se vraća na sigurniju varijantu i obrađuje kompletnu sliku.

Takva konstrukcija pokušava da spoji dve suprotne potrebe. Sa jedne strane, model treba da uštedi tokene i računanje tako što neće analizirati sve piksele kada to nije potrebno. Sa druge, sistem ne sme da postane krhak ako EEG klasifikator pogreši. Pragovi pouzdanosti služe upravo kao zaštita: agresivno kadriranje koristi se samo kada se EEG i vizuelni detektor dovoljno slažu.

Benchmark sa 40 klasa i 600 pitanja

Za evaluaciju autori su se oslonili na EEG-ImageNet i napravili benchmark sa 40 klasa. U njemu se nalaze generisane pretrpane scene i realne slike fokusirane na objekte, uz anotacije ciljnog regiona i ukupno 600 parova vizuelnih pitanja i odgovora na engleskom jeziku. Time se sistem proverava i u kontrolisanijim i u vizuelno zahtevnijim situacijama.

Posebno je važno što benchmark meri ne samo da li je odgovor tačan već i da li fokusiranje na manji region zaista smanjuje računarski teret. To je centralna ideja rada: ljudski neuralni signal ne koristi se kao zamena za računarski vid, već kao dodatni signal koji pomaže modelu da odluči kada može bezbedno da ignoriše veliki deo scene.

Veća tačnost uz manje tokena i FLOPs-a

Na Qwen3.5-VL modelima od 2B, 4B i 9B parametara BrainFocus je, prema rezultatima rada, povećao tačnost VQA zadataka na pretrpanim scenama za 4,14 do 9,87 procentnih poena. Istovremeno su broj ulaznih tokena i ukupan broj tokena smanjeni približno 23,2 do 39,4 odsto, dok je procenjeni broj operacija sa pokretnim zarezom smanjen približno 23,2 do 39,5 odsto.

Autori zaključuju da EEG može da usmerava efikasniju inferencu vision-language modela čak i kada semantičko dekodiranje iz moždanog signala nije savršeno. Rezultati zato ne pokazuju da EEG sam razume scenu, već da u kombinaciji sa detektorom i sigurnosnim pragovima može da pomogne modelu da obradi manje vizuelnog sadržaja bez gubitka, a u testovima čak i uz dobitak u tačnosti.

Šta ovaj rezultat znači

Najzanimljiviji deo BrainFocus pristupa je arhitektura odluke: sistem ne bira između EEG-a i računarskog vida, već ih kombinuje i koristi punu sliku kao rezervnu opciju. To smanjuje rizik da pogrešno dekodiran EEG signal usmeri model na potpuno pogrešan objekat, a istovremeno zadržava mogućnost značajne uštede kada su signali dovoljno pouzdani.

Izvori

Prikazani su izvorni linkovi korišćeni za proveru objavljenih činjenica.

Komentari

Komentari se objavljuju nakon moderacije.

Još nema objavljenih komentara.