Rad upozorava na kaskadne napade kroz više AI skill modula
Istraživači predstavljaju SkillCascade, okvir za testiranje slučajeva u kojima pojedinačni AI skill moduli izgledaju bezazleno, ali njihova kombinacija može proizvesti štetno ponašanje.

Rizik nastaje između komponenti
Autori uvode pojam skill cascading attack za napad u kojem je maliciozni cilj raspoređen kroz više skill modula, tako da svaka pojedinačna izmena može delovati benigno, dok njihova zajednička primena proizvodi štetan ishod.
Rad navodi da su prethodna istraživanja uglavnom posmatrala ranjivosti pojedinačnih skillova, dok su rizici koji nastaju njihovom međusobnom interakcijom dobijali manje pažnje.
Benchmark sa 213 validiranih testova
Za sistematsko ispitivanje tog problema autori su napravili SkillCascade, automatizovani multi-agent red-teaming okvir, i SkillCascade-Bench sa 213 validiranih kaskadnih test slučajeva.
Prema rezultatima autora, kaskadne interakcije su izazivale štetna ponašanja kroz različite agente i LLM pozadine, dok su postojeći skeneri pojedinačnih skillova i runtime monitori propuštali deo tih slučajeva.
Zaključak rada je da bezbednost sistema ne može da se procenjuje samo na nivou pojedinačnih komponenti, već mora da uključuje i interakcije među njima.
Izvori
Prikazani su izvorni linkovi korišćeni za proveru objavljenih činjenica.
