AI modeli za astronomiju: specijalizacija ne znači automatski i bolje rezonovanje
Novi rad poredi opšte, multimodalne i astronomski specijalizovane modele na benchmarku otvorenih naučnih pitanja.

Benchmark iz astronomije
Autori proučavaju domensku specijalizaciju na kuriranom astronomskom benchmarku sastavljenom iz javno dostupnih olimpijadskih materijala iz perioda 2017–2026.
Deo benchmarka sa slobodnim odgovorima sadrži 300 pitanja, od kojih je 204 tekstualno, a 96 povezano sa slikama.
U radu se porede opšti, multimodalni i astronomski specijalizovani modeli, uključujući open-weight i API-servirane sisteme.
Rezultati nisu jednodimenzionalni
U ovom testnom skupu najjači opšti modeli postavili su najviši nivo tačnosti, dok su dodatne analize pokazale razlike koje jedan jedini leaderboard ne prikazuje.
Autori zato zaključuju da domensku specijalizaciju treba posmatrati u zavisnosti od zadatka i načina primene, a ne kao univerzalnu prednost.
Naslov rada je „Rethinking Domain Specialization for Open-Ended Scientific Reasoning in Astronomy Language Models“.
Izvori
Prikazani su izvorni linkovi korišćeni za proveru objavljenih činjenica.

Komentari
Komentari se objavljuju nakon moderacije.
Još nema objavljenih komentara.