Kako proveriti da li AI agent za kupovinu zaista radi dobro, a ne samo da završi kupovinu

Novi benchmark za e-commerce agente meri mnogo više od konačnog uspeha: prati preteranu kupovinu, nedovoljno delovanje, izmišljene osobine proizvoda, lošu pretragu i ponašanje kroz celu konverzaciju.

Jedan rezultat skriva mnogo različitih grešaka

Kod AI agenata za internet kupovinu jednostavna mera uspeha može da bude varljiva. Dva sistema mogu da završe sa istom korpom, ali da do nje dođu potpuno različitim putem: jedan može da pronađe traženi proizvod uredno, dok drugi pretražuje pogrešno, kupi previše stvari ili korisniku pripiše zahteve koje nikada nije naveo.

Zbog toga novi rad predlaže determinističko i ponovljivo e-commerce okruženje u kojem se unapred definišu persona kupca, težina zadatka, ciljna korpa i raspored otkrivanja proizvoda. Simulirani kupac zatim pokušava da dođe do ciljne korpe uz pomoć AI modela koji se evaluira.

Sistem beleži svaku akciju agenta

Okruženje vodi ponašanje simulatora i beleži svaku akciju asistenta zajedno sa stanjem sistema u trenutku kada je akcija izvršena. Posle probe, evaluator može da proverava pojedinačne delove razgovora prema sačuvanim dokazima, umesto da ocenjuje samo konačan rezultat.

To omogućava da se ista radnja ocenjuje različito u zavisnosti od konteksta. Na primer, neuspešna pretraga ciljnog proizvoda kažnjava se tek ako je kupac taj proizvod već pomenuo, pa se agent ne penalizuje za informaciju koju još nije mogao da zna.

Različite kazne za različite greške

Autori koriste sačuvane dokaze i da različito penalizuju pozive alata, u zavisnosti od toga kako se stvarna akcija asistenta razlikuje od očekivanog skupa poziva. Time benchmark pokušava da razlikuje slučaj kada agent nije uradio dovoljno od slučaja kada je preterano intervenisao ili izvršio radnju koju stanje razgovora nije opravdavalo.

Okruženje nije jednosmerno. Ono čita izlaz simulatora, može da prekine probu kada simulirani kupac postane previše frustriran i u realnom vremenu ubacuje instrukcije koje određuju kada treba istražiti dodatne opcije, odložiti kupovinu ili se vratiti na prethodni deo razgovora.

Testirano osam otvorenih modela

Benchmark je primenjen na osam open-weight agenata veličine od 20 do 35 milijardi parametara. Za svaki model sprovedeno je 160 proba i praćene su 44 metrike, što daje znatno detaljniji profil ponašanja od jedne stope uspeha zadatka.

Dobijeni profili razlikuju nedovoljno delovanje, prekomernu kupovinu, nepodržane tvrdnje o osobinama proizvoda i lošu pretragu. Upravo te kategorije mogu da ostanu skrivene ako se gleda samo da li je na kraju kupljena odgovarajuća korpa.

Zašto je ovakav benchmark važan

Kako agenti dobijaju pristup pretrazi, korpi, plaćanju i drugim alatima, pitanje kvaliteta više nije samo da li umeju da daju dobar odgovor u chatu. Važno je da njihove akcije budu opravdane informacijama koje su zaista dostupne u tom trenutku i da sistem može da objasni gde je agent odstupio od očekivanog ponašanja.

Predloženo okruženje zato pokušava da spoji otvorenu konverzaciju sa proverljivim tragom događaja. Simulacija ostavlja agentu više mogućih puteva do cilja, ali istovremeno čuva dovoljno podataka da se naknadno proveri da li je pretraga bila opravdana, da li je alat pozvan u pravom trenutku i da li je kupac dobio ponašanje koje odgovara njegovim zahtevima.

Otvorena simulacija, ali proverljiva

Autori posebno naglašavaju da interakcija ostaje otvorena: simulator i agent mogu da menjaju tok razgovora, a okruženje reaguje na njihovo ponašanje u realnom vremenu. Istovremeno, svaka akcija se zapisuje zajedno sa stanjem okruženja, pa se na kraju može rekonstruisati zašto je određena pretraga, kupovina ili poziv alata ocenjen kao dobar ili problematičan.

Izvori

Prikazani su izvorni linkovi korišćeni za proveru objavljenih činjenica.

Komentari

Komentari se objavljuju nakon moderacije.

Još nema objavljenih komentara.