CLIP reprezentacije mogu da otkrivaju AI-generisane slike uz lagan klasifikator

Istraživanje ispituje da li zamrznuti CLIP već sadrži signal koji razlikuje AI-generisane od stvarnih slika i kombinuje njegove vizuelne reprezentacije sa malim klasifikatorima.

Da li CLIP već nosi signal o poreklu slike

Autori polaze od problema da je provera autentičnosti AI-generisanih slika sve važnija na društvenim mrežama, dok CLIP tokom pretreniranja nije dobijao eksplicitne oznake koje bi razlikovale AI-generisani sadržaj od stvarnih fotografija.

Rad zato proverava da li same CLIP reprezentacije ipak implicitno sadrže informacije koje ukazuju na AI poreklo slike.

Zamrznut CLIP, mali klasifikator

Predloženi cevovod izvlači vizuelne embeddinge iz zamrznutog CLIP modela, prosleđuje ih laganim mrežama i fino podešava samo završni klasifikator, umesto kompletnog multimodalnog modela.

Na javnom CIFAKE benchmarku autori prijavljuju 95 odsto tačnosti bez jezičkog rezonovanja, dok few-shot prilagođavanje sa 20 odsto kuriranih podataka daje rezultat od 85 odsto.

Neki stilovi ostaju teški

Širokougaone fotografije i uljane slike izdvojene su kao posebno zahtevni tipovi sadržaja, što pokazuje da problem nije ravnomerno težak kroz sve vizuelne stilove.

Zatvoreni Gemini-2.0 baseline imao je najbolju zero-shot tačnost, ali je takođe grešio na određenim stilovima, pa autori zaključuju da ostaju specifična otvorena pitanja u detekciji AI-generisanih slika.

Izvori

Prikazani su izvorni linkovi korišćeni za proveru objavljenih činjenica.

Komentari

Komentari se objavljuju nakon moderacije.

Još nema objavljenih komentara.