Benchy predlaže zajednički jezik za opis i izvršavanje AI benchmarka
Novi preprint predstavlja Benchy, semantički jezik i execution engine koji benchmarke opisuje kroz program, scoring funkciju i skup podataka, odvojeno od AI sistema koji se testira.

Jedna kanonska sintaksa za benchmark
Benchy benchmark definiše kao kombinaciju programa, scoring funkcije i skupa podataka, dok se AI sistem tretira odvojeno i vezuje za benchmark tek tokom konkretnog pokretanja.
Benchmarki se pišu u kanonskom YAML formatu, klasifikuju zajedničkom ontologijom zadatka, domena i jezika, a zatim deterministički prevode u kanonski JSON međureprezentacioni format koji izvršava engine.
Autori naglašavaju da kompilacija menja samo reprezentaciju, ne i značenje, i da ne popravlja nevalidne definicije niti ubacuje skrivene podrazumevane vrednosti.
Jedinstven runtime ugovor
Programi koriste fiksne šeme imenovanih ulaznih i izlaznih polja, dok su leaf izlazna polja dimenzije po kojima se rezultat ocenjuje.
Cilj je da različiti AI sistemi prilagođavanje rade samo na granici integracije, bez unošenja tehničkih detalja integracije u samu semantiku benchmarka.
Izvori
Prikazani su izvorni linkovi korišćeni za proveru objavljenih činjenica.
