Novi okvir upozorava da dobra AI metrika nije isto što i dokaz stvarne koristi
Rad „From Protocols to Evidence“ predlaže strože granice za tvrdnje o AI sistemima: bolja predikcija, nadzor ili brže izvršenje zadatka sami po sebi ne dokazuju bezbednost, kontrolu ili korist za korisnike.

Kada evaluacija obećava više nego što stvarno meri
Tvrdnje da AI poboljšava odluke, širi pristup uslugama, smanjuje štetu ili osnažuje korisnike često zvuče šire od onoga što je konkretna evaluacija zaista proverila. Novi rad „From Protocols to Evidence“ polazi od tog problema i pokušava da uvede jasnu granicu između rezultata koji su izmereni i širih zaključaka koji se iz tih rezultata izvode.
Autori posebno naglašavaju da dobra prediktivna tačnost sama po sebi ne dokazuje da je sistem bezbedan. Isto tako, činjenica da postoji ljudski nadzor ne znači automatski da ljudi imaju stvarnu kontrolu, a brže završavanje zadatka nije isto što i dokaz da korisnik bolje razume situaciju ili ima veći izbor.
Problem počinje tek kada sistem uđe u stvarno okruženje
Evaluacija pre uvođenja sistema može da izmeri greške i prosečne performanse, ali rad upozorava da se deo rizika pojavljuje tek posle implementacije. Korisnici mogu previše da se oslone na AI, mogućnosti žalbe i ljudske korekcije mogu da oslabe, a stručnost zaposlenih može postepeno da bude potisnuta čak i kada osnovna metrika modela izgleda dobro.
Zato autori AI opisuju istovremeno kao „revelation“ i „intervention“: njegovo korišćenje može da otkrije nezadovoljene potrebe i pretpostavke institucije, ali istovremeno menja samo okruženje u kojem se koristi. Jednom kada je uveden, sistem može da popravi postojeći problem, ali može i da ga pojača, zameni drugim problemom ili prikrije da kvar i dalje postoji.
„Rupture test“ poredi AI i sa ljudskim i sa ne-AI alternativama
Kao praktičan odgovor na taj problem, rad uvodi rupture test. Umesto da se AI poredi samo sa drugim AI modelom ili sa jednom internom metrikom, predlog je da se implementacija poredi sa eksplicitnim ljudskim i ne-AI baznim rešenjima. Tako pitanje više nije samo „da li je model bolji“, već „u odnosu na šta je bolji i šta se menja kada ga uvedemo“.
Autori tvrde da procena poboljšanja mora da uzme u obzir šta institucija zapravo vrednuje i koje uslove pokušava da promeni. Teži deo evaluacije zato nije samo statistika, nego granica dokaza: koje tvrdnje rezultati zaista podržavaju, koje odnose moći nisu ni proverili i gde sama metrika više ne može da odgovori na pitanje da li je promena dobra.
Tvrdnja treba da bude velika samo koliko i dokaz
Centralni princip rada može se sažeti jednostavno: tvrdnja o AI sistemu ne bi smela da bude šira od evaluacije koja je podržava. Ako je test pokazao veću tačnost na određenom skupu podataka, onda je to ono što je dokazano. Iz tog rezultata ne treba automatski izvoditi da je sistem bezbedniji, pravedniji ili da korisnicima daje više kontrole, osim ako su i te osobine posebno merene.
Rad tako pokušava da razdvoji evidence-bounded deployment, gde se javne i interne tvrdnje ograničavaju na ono što je testirano, od šireg upravljanja u kojem postoje i ograničenja koja čak ni povoljan rezultat merenja ne može automatski da ukloni. To je pokušaj da se evaluacija pretvori iz jedne završne ocene u dokumentovan lanac tvrdnje, odgovornosti i dokaza.
Širi okvir uključuje dostojanstvo, infrastrukturu i odgovornost
Autori povezuju tehničku evaluaciju sa širim pitanjima o tome ko poseduje AI infrastrukturu, ko kontroliše način upotrebe sistema i ko snosi posledice kada odluka krene pogrešno. U radu se pozivaju i na Magnifica Humanitas pape Lava XIV kao jedan od normativnih izvora za razmatranje dostojanstva i zajedničkog dobra. To nije tehnički dokaz, već deo vrednosnog okvira kroz koji autori tumače granice odgovorne primene.
Najkorisnija praktična poruka rada zato nije da jedna metrika treba da bude zamenjena drugom, već da se za svaku veliku tvrdnju o koristi AI sistema jasno pokaže koji je dokaz podržava, ko za nju odgovara i koji bi novi rezultat zahtevao da se ta tvrdnja ograniči ili povuče. Time se fokus pomera sa marketinga rezultata na proverljivost granica samog dokaza.
Izvori
Prikazani su izvorni linkovi korišćeni za proveru objavljenih činjenica.

Komentari
Komentari se objavljuju nakon moderacije.
Još nema objavljenih komentara.