Studija: Visok cosine similarity posle kvantizacije sam po sebi nije dokaz očuvane interpretacije

Novi rad upozorava da veoma visok cosine similarity između full-precision i kvantizovanih interpretability pravaca može nastati i zbog samog statističkog noise floor-a procene.

Zašto broj blizu jedan može da zavara

Autori tvrde da prijavljeni cosine similarity bez količine potrebne za njegovo tumačenje nije dovoljan dokaz očuvanja interpretability pravca posle kompresije modela.

Za difference-in-means estimator uvode odnos kappa koji zavisi od broja uzoraka, razdvajanja klasa i dimenzionalnosti i određuje očekivani split-half noise floor.

Primer na Qwen2.5-1.5B-Instruct

Na Qwen2.5-1.5B-Instruct autori mere dovoljno veliko razdvajanje da dve nezavisne procene samim uzorkovanjem imaju slaganje od približno 0,978 do 0,994 kroz dubinu modela.

Zbog toga, navode autori, objavljeni cosine od 0,996 između full-precision i kvantizovanog refusal pravca ne može automatski da se čita kao očuvanje ako nije poznat broj uzoraka i odgovarajući noise floor.

Kada je broj uzoraka poznat, rad preporučuje poređenje sa split-half nulom izračunatom unutar samog kvantizovanog modela.

Izvori

Prikazani su izvorni linkovi korišćeni za proveru objavljenih činjenica.