PP-ProPS skriva parametre robotske politike od LLM provajdera tokom optimizacije
Privacy-preserving prompted policy search kodira parametre i reward vrednosti na klijentskoj strani pre slanja LLM API-ju, dok model i dalje pomaže u pretrazi politike.

LLM vidi kodirane parametre i skalirane reward signale
PP-ProPS primenjuje tajne klijentske transformacije na parametre politike i reward vrednosti pre svakog API zahteva, tako da LLM provajder vidi samo kodirane parametre i skalirane reward informacije.
Za razliku od Vanilla ProPS pristupa, okvir ne zahteva da stvarni optimalni episodic return bude poznat ili otkriven LLM-u.
Više informacija o pojedinačnim reward komponentama
Metod LLM-u daje pojedinačne reward komponente umesto samo ukupnog return-a, kako bi povratna informacija o kandidatskoj politici bila detaljnija.
Autori navode da PP-ProPS nadmašuje Vanilla ProPS u sedam od deset evaluiranih zadataka i da je bolji od PPO, SAC i TRPO u pet od šest zadataka u kojima su poređeni.
Cilj je istovremeno zaštititi optimizacione podatke i poboljšati sam proces pretrage politike.
Izvori
Prikazani su izvorni linkovi korišćeni za proveru objavljenih činjenica.
