AI training: zajednički learning rate nije neutralna kontrola u selektivnoj distilaciji

Novi rad pokazuje da izbor learning rate-a može bitno da promeni zaključke o tome koji selektivni metod distilacije izgleda bolji, pa autori predlažu detaljnije izveštavanje rezultata po svakoj grani i stopi učenja.

Selektivne metode reaguju mnogo jače na stopu učenja

U LoRA eksperimentima na GSM8K, kroz osam različitih learning rate vrednosti, dense supervision je varirao 1,8 procentnih poena, dok su selektivne grane menjale rezultat od 5,4 do čak 17,7 poena.

Autori navode da se razlika između dense i selektivnog pristupa menjala sa 10,1 procentni poen pri stopi 1e-4 na 5,1 poen pri 5e-5, dok su se dve od šest statističkih odluka menjale između susednih stopa.

Predlog za drugačije izveštavanje

Rad zato predlaže da se prijavljuje matrica rezultata za svaku eksperimentalnu granu i svaku stopu učenja, umesto jedne zajedničke kolone.

Na MATH-500 isti obrazac zavisnosti od stope učenja nije ponovljen pod LoRA uslovima, što ograničava širinu zaključka.

Izvori

Prikazani su izvorni linkovi korišćeni za proveru objavljenih činjenica.

Komentari

Komentari se objavljuju nakon moderacije.

Još nema objavljenih komentara.