AI modeli za astronomiju: specijalizacija ne znači automatski i bolje rezonovanje

Novi rad poredi opšte, multimodalne i astronomski specijalizovane modele na benchmarku otvorenih naučnih pitanja.

Benchmark iz astronomije

Autori proučavaju domensku specijalizaciju na kuriranom astronomskom benchmarku sastavljenom iz javno dostupnih olimpijadskih materijala iz perioda 2017–2026.

Deo benchmarka sa slobodnim odgovorima sadrži 300 pitanja, od kojih je 204 tekstualno, a 96 povezano sa slikama.

U radu se porede opšti, multimodalni i astronomski specijalizovani modeli, uključujući open-weight i API-servirane sisteme.

Rezultati nisu jednodimenzionalni

U ovom testnom skupu najjači opšti modeli postavili su najviši nivo tačnosti, dok su dodatne analize pokazale razlike koje jedan jedini leaderboard ne prikazuje.

Autori zato zaključuju da domensku specijalizaciju treba posmatrati u zavisnosti od zadatka i načina primene, a ne kao univerzalnu prednost.

Naslov rada je „Rethinking Domain Specialization for Open-Ended Scientific Reasoning in Astronomy Language Models“.

Izvori

Prikazani su izvorni linkovi korišćeni za proveru objavljenih činjenica.

Komentari

Komentari se objavljuju nakon moderacije.

Još nema objavljenih komentara.