AI zadaci između telefona, edge sistema i clouda: kako smanjiti pregrevanje
Novi rad testira sistem HybridInfer koji bira gde će se izvršiti LLM upit — na telefonu, edge serveru ili u cloudu — uzimajući u obzir složenost upita, cenu, kašnjenje i trenutno termalno stanje uređaja.

Zašto lokalni AI na telefonu ima ograničenja
Autori rada navode da lokalno pokretanje manjih jezičkih modela čuva podatke na uređaju, radi i bez interneta i nema cenu po pojedinačnom upitu, ali da je takav pristup ograničen termalnim mogućnostima telefona.
U eksperimentima na Snapdragon uređaju autori su zabeležili da duže lokalno generisanje može da destabilizuje GPU inference runtime, uz pad ili blokiranje sistema posle nekoliko uzastopnih upita.
Prema radu, problem nije bio samo u visokoj temperaturi, već i u postojećem OpenCL toolchainu, kompilaciji kernela i prefill fazi kod dugih promptova.
HybridInfer bira između tri nivoa izvršavanja
HybridInfer je predstavljen kao ruter koji bira između lokalnog modela na telefonu, edge modela i cloud modela, koristeći termalni prostor uređaja i procenu složenosti upita kao deo stanja za donošenje odluke.
Autori naglašavaju da postojeći višeslojni ruteri uglavnom ne uzimaju u obzir termalno stanje uređaja i često se procenjuju u simulacijama ili na hardveru koji nije mobilni.
Bez dodatnog bonusa za lokalno izvršavanje, navodi se u radu, optimalna politika bi praktično prebacivala svaki upit van uređaja, pa je taj element bio potreban da bi termalno svesno rutiranje imalo smisla.
Rezultati na stvarnom Android uređaju
Na benchmarku od 210 upita na stvarnom Android uređaju, naučeni ruter je prema autorima ostvario viši kvalitet od dve ručno podešene heuristike, uz najniži trošak među adaptivnim uslovima u tom testu.
Varijanta koja je sve upite izvršavala samo na telefonu postizala je sličan kvalitet tamo gde je upit mogao da se obradi, ali je bila tri do šest puta sporija i nije uspevala na dugim upitima.
Autori zato zaključuju da korist rutiranja u njihovom eksperimentu nije bila samo u kvalitetu odgovora, već pre svega u latenciji, pouzdanosti i pokrivenosti različitih vrsta upita.
Izvori
Prikazani su izvorni linkovi korišćeni za proveru objavljenih činjenica.
