Benchy predlaže zajednički jezik za opis i izvršavanje AI benchmarka

Novi preprint predstavlja Benchy, semantički jezik i execution engine koji benchmarke opisuje kroz program, scoring funkciju i skup podataka, odvojeno od AI sistema koji se testira.

Jedna kanonska sintaksa za benchmark

Benchy benchmark definiše kao kombinaciju programa, scoring funkcije i skupa podataka, dok se AI sistem tretira odvojeno i vezuje za benchmark tek tokom konkretnog pokretanja.

Benchmarki se pišu u kanonskom YAML formatu, klasifikuju zajedničkom ontologijom zadatka, domena i jezika, a zatim deterministički prevode u kanonski JSON međureprezentacioni format koji izvršava engine.

Autori naglašavaju da kompilacija menja samo reprezentaciju, ne i značenje, i da ne popravlja nevalidne definicije niti ubacuje skrivene podrazumevane vrednosti.

Jedinstven runtime ugovor

Programi koriste fiksne šeme imenovanih ulaznih i izlaznih polja, dok su leaf izlazna polja dimenzije po kojima se rezultat ocenjuje.

Cilj je da različiti AI sistemi prilagođavanje rade samo na granici integracije, bez unošenja tehničkih detalja integracije u samu semantiku benchmarka.

Izvori

Prikazani su izvorni linkovi korišćeni za proveru objavljenih činjenica.