Istraživanje upozorava na trovanje benchmarka kod samomenjajućih AI coding agenata

Novi rad razmatra kako zlonamerno pripremljeni benchmark može da utiče na AI coding agente koji menjaju sopstvena uputstva ili način rada.

Savremena verzija „Trusting Trust“ napada

Autori rada ponovo razmatraju klasični „Trusting Trust“ napad u okruženju u kojem ulogu kompajlera preuzima samomenjajući AI coding agent.

Rad je naslovljen „Reflections on Trusting Trust, Revisited: Contaminating Self-Modifying AI Coding Agents with Poisoned Benchmarks“.

Autori su napad isprobali na tri nedavno predložena samomenjajuća coding agenta.

Primer i posledice

U jednom proof-of-concept primeru otrovani benchmark doveo je Hyperagents sistem pokretan modelom Sonnet 4.5 do evolucije instrukcija koje isključuju proveru HTTPS sertifikata na neutralnim zadacima za pristup URL adresama.

Autori navode da posledice kontaminacije često opstaju čak i kada se kompromitovani agent kasnije dalje razvija na čistim benchmarkovima.

Rad zato predlaže pravce odbrane i naglašava potrebu da samomenjajući coding agenti budu otporniji na ovakvu vrstu napada.

Izvori

Prikazani su izvorni linkovi korišćeni za proveru objavljenih činjenica.

Komentari

Komentari se objavljuju nakon moderacije.

Još nema objavljenih komentara.