Način sastavljanja streama može da preokrene rezultat intrusion-detection benchmarka
Studija pokazuje da interleaving, pooling i redosled network capture podataka nisu neutralni detalji evaluacije: mogu promeniti prevalenciju, test skup i čak poredak determinističkih detektora.

Stream assembly je eksperimentalni tretman, ne tehnički detalj
Streaming intrusion-detection radovi često formiraju evaluacione tokove tako što mešaju dane snimanja, pool-uju capture skupove ili replay-uju zapise round-robin redosledom. Novi rad pokazuje da takav izbor nije samo način pakovanja istih podataka, već nekontrolisani eksperimentalni tretman koji menja ono što benchmark zapravo meri.
To je posebno važno kada se rezultati porede između radova. Ako dva eksperimenta koriste isti detektor i isti skup zapisa, ali ih drugačije rasporede kroz train/test tok, razlika u rezultatu može poticati iz sastavljanja streama, a ne iz sposobnosti detektora da uči istoriju mrežnog ponašanja.
Isti zapisi, drugačiji test skup i obrnut poredak
Na CICIDS2017 autori uzimaju identičan multiset zapisa, menjaju samo redosled i zatim primenjuju fiksni pozicioni split 70/15/15. Dva held-out skupa dele svega 32,5% zapisa, dok im prevalencije iznose 68,235% i 25,2396% — razlika od 42,9954 procentna poena.
Još važnije, takva promena preokreće izmereni poredak dva deterministička scorera. Kada se oba kraka ograniče na zajedničkih 78.000 zapisa koji su završili u oba held-out skupa, reversal nestaje, što rezultat vezuje za izbor test zapisa koji je napravila assembly procedura.
Autori pritom navode i ogradu: atribucija pretpostavlja da doprinos istorije na zapisima koji nisu zajednički nije veći nego na zapisima koje oba eksperimenta dele. Time jasno razdvajaju ono što je direktno pokazano od dodatne pretpostavke potrebne za šire tumačenje.
Pooling može da sakrije velike razlike prevalencije
Na LITNET-2020 pooling tri vremenski razdvojena capture-a daje jednu prijavljenu operativnu tačku od 6,4982%. Ta vrednost je jednaka sredini held-out prevalencija pojedinačnih capture-a, koje se kreću od samo 0,176% do 15,7747%.
Takav raspon pokazuje zašto jedna pooled prevalencija može da prikrije koliko su različita okruženja iz kojih podaci dolaze. Za anomaly i intrusion detection to je kritično, jer precision-recall metrike snažno zavise od udela pozitivnih primera, pa poređenje bez assembly konteksta može da izgleda mnogo stabilnije nego što stvarno jeste.
Neke implementacije zavise i od batcha uz isti model
Rad pokazuje i primer ECOD reference implementacije: kada su evaluirani zapisi i fitted model fiksni, promena samo pratećeg batcha pomera AUC-PR za 0,003063. To znači da objavljeni ECOD brojevi nisu direktno uporedivi između studija ako scoring rade na različitim batch sastavima.
Kod drugog evaluiranog detektora reset posterior P(r_t=0) jednak je hazard rate-u ispod run-length capa, ali evaluacija najveći deo vremena provodi na capu ili preko njega, dok korišćeni skor zavisi od P(r<=5), a ne direktno od P(r=0). To dodatno pokazuje koliko implementacioni detalji metrike mogu promeniti interpretaciju.
Kombinovanje signala može da pogorša rezultat
U deployed max kompoziciji prijavljeni rezultat je lošiji od samog tail termina: 0,103477 AP i 0,302658 AUC-ROC. Razlog je invertovana pomoćna grana sa AUC-ROC 0,281890, a max operator joj dozvoljava da postavi skor upravo tamo gde je tail mali.
Ovaj primer je važan jer pokazuje da složeniji detector stack nije automatski bolji. Ako je pomoćni signal pogrešno orijentisan ili drugačije kalibrisan, kompozicija može da degradira odluku čak i kada pojedinačna glavna komponenta radi bolje.
Reproduktivnost zahteva manifest celog evaluacionog toka
Svaka merena vrednost u radu povezana je sa arhiviranim i hash-proverenim run manifestom. Takav audit trag omogućava da se ne proverava samo kod modela, već i tačan redosled podataka, split, batch i konfiguracija koji su proizveli objavljeni broj.
Praktična poruka za IDS benchmarke je jednostavna: stream assembly treba tretirati kao deo eksperimentalne metode i objaviti ga sa istom pažnjom kao model i hiperparametre. Bez toga rezultat može da meri strukturu test skupa više nego sposobnost detektora, a poređenja između radova mogu biti prividno precizna.
Izvori
Prikazani su izvorni linkovi korišćeni za proveru objavljenih činjenica.

Komentari
Komentari se objavljuju nakon moderacije.
Još nema objavljenih komentara.