Studija meri kada AI sudija za kod zapravo nema dovoljno osnova za odluku
Novi rad ispituje multi-agent sisteme koji procenjuju tačnost koda i predlaže dve metrike bez labela koje mogu da pokažu kada sudija nema dovoljno dokaza za pouzdan odgovor.

Samouveren odgovor ne znači da postoji osnova
Autori polaze od problema da jezički model koji procenjuje tuđi kod često ne prijavljuje nedostatak dokaza, već daje samouveren zaključak sa obrazloženjem i kada za njega nema dovoljno osnove.
Autori tvrde da verifikacioni pristupi traže da dokaz bude nezavisan od odgovora koji se ocenjuje i da se razlikuje između kandidata koji se porede.
Merenje kada je bolje odbiti odgovor
Na 80 kombinacija uslova u dva benchmarka za ocenjivanje koda, okvir MARCH je u 78 do 95% poređenja proglašavao oba rešenja jednako dobrim, uz samo 4,4% tačnosti u jednom režimu u kojem je direktno pitanje istom modelu dalo 43,7%.
Kada je uveden gate zasnovan na jednoj od novih metrika i sistem odbijao poređenja za koja nema osnovu, tačnost je porasla sa 20,7% na 36,9%, uz odgovor na polovinu poređenja.
Glavni doprinos rada nije novi najtačniji sudija, već način da se bez referentnih labela prepozna kada sudija nema dovoljno osnova za zaključak.
Izvori
Prikazani su izvorni linkovi korišćeni za proveru objavljenih činjenica.
