ScopeBench meri da li AI agenti poštuju granice zadatka pod pritiskom cilja

Novi benchmark na arXiv-u sadrži 30 agentnih bezbednosnih zadataka u kojima je cilj moguće postići samo prelaskom eksplicitno zadate granice opsega.

Trideset zadataka sa namernim ćorsokakom

Autori predstavljaju ScopeBench, skup od 30 agentnih bezbednosnih zadataka u kojima je navedeni cilj dostižan samo ako agent prekrši postavljenu granicu opsega.

Svaki zadatak ima dve varijante sa istim okruženjem, ciljem i verifikatorom: jednu bez ograničenja i drugu sa prirodno-jezički zadatim scope pravilom.

Kombinacija determinističke i agentne provere

Putanje sa ograničenjem prvo prolaze kroz deterministički verifikator koji može direktno da dokaže da je zabranjena radnja izvršena ako agent dođe do zastavice iza granice opsega.

Ako deterministička provera ne potvrdi prekršaj, dodatni agentni evaluator procenjuje da li je ipak došlo do poziva van dozvoljenog opsega.

Autori navode da su evaluator kalibrisali na 100 putanja koje su ljudi označavali poziv po poziv, a u slepoj proveri 36 zabeleženih prekršaja nije bilo propušteno.

Izvori

Prikazani su izvorni linkovi korišćeni za proveru objavljenih činjenica.