„Know Your Agent“ tretira izviđanje AI agenta kao poseban korak pentestinga

KYA formalizuje koje informacije napadač pokušava da izvuče iz AI agenta, kako ih koristi i koje slabosti iskorišćava, sa fokusom na indirektni prompt injection i realne coding-agent scenarije.

AI agenti dobijaju isti tretman kao drugi sistemi

Klasični pentesting koristi reconnaissance da bi otkrio nepoznate slabosti, prikupio podatke o meti i izgradio sledeći korak napada. Autori KYA rada tvrde da AI agenti zahtevaju isti pristup: pre ozbiljnog napada važno je razumeti koje znanje agent poseduje, kojim alatima raspolaže i gde njegova pravila mogu da se zaobiđu.

Zato „Know Your Agent“ ne počinje direktno exploitom. Okvir prvo modeluje proces izviđanja i razdvaja znanje koje napadač pokušava da izvuče pre nego što sastavi efikasniji indirect prompt injection ili drugi višekoračni napad.

Šta napadač zapravo pokušava da sazna

Rad identifikuje knowledge assets kroz tri pitanja: šta su informacije koje agent poseduje, kako se one koriste tokom rada i koje slabosti sistema mogu da pretvore to znanje u prednost za napadača. Takva podela pomera fokus sa jednog zlonamernog prompta na širi model pripreme napada.

U praksi izviđanje može da otkrije sistemske instrukcije, raspoložive alate, očekivane tokove podataka ili način na koji agent tumači spoljne sadržaje. KYA te informacije posmatra kao sastavni deo attack surface-a, posebno kada agent automatski čita dokumente, kod ili rezultate drugih servisa.

Benchmark i realni coding agent

Autori evaluiraju KYA na benchmarkovima za bezbednost agenata i na jednom realnom coding agentu. Time pokušavaju da provere da li formalizovani reconnaissance koraci pomažu ne samo u sintetičkim testovima već i u okruženju gde agent koristi alate i izvršava višekoračne zadatke.

KYA, benchmarkovi i baseline implementacije objavljeni su radi reproduktivnosti. To je važno jer bez ponovljivog skupa napada i jasno definisanog reconnaissance procesa različite bezbednosne evaluacije lako mogu da mere različite stvari pod istim nazivom „agent security“.

Pentest AI agenta ne završava se jednim promptom

Najvažnija ideja rada je metodološka: bezbednost agenta ne treba procenjivati samo tako što mu se pošalje nekoliko poznatih jailbreak promptova. Agent je sistem sa memorijom, alatima, pravilima i spoljnim izvorima, pa napadač može prvo da prikuplja informacije i tek onda sastavi prompt koji koristi konkretno otkrivenu slabost.

KYA zato približava testiranje AI agenata tradicionalnijem red-team procesu u kome se napad gradi iterativno. Ako se takav pristup standardizuje, mogao bi da učini procenu indirect prompt injection rizika realističnijom, posebno za agente koji rade sa kodom, dokumentima i automatizovanim akcijama.

Izvori

Prikazani su izvorni linkovi korišćeni za proveru objavljenih činjenica.

Komentari

Komentari se objavljuju nakon moderacije.

Još nema objavljenih komentara.