Audio LLM može iz svojih audio reprezentacija da proceni kada je transkripcija nepouzdana
Novi rad pokazuje da standardni signali ne otkrivaju dobro neuspešnu transkripciju, dok audio-encoder reprezentacije nose dovoljno informacije za lagani prediktor pouzdanosti pre generisanja odgovora.

Problem počinje pre odgovora modela
Kada je snimak previše degradiran, audio jezički model može pogrešno da protumači korisnikov upit i zatim odgovara na osnovu netačne transkripcije.
Autori nalaze da prediktori kvaliteta govora, generativna nesigurnost audio LLM-a i procena WER-a na osnovu transkripta daju ograničene signale za otkrivanje takvih grešaka.
Nasuprot tome, pouzdanost transkripcije je snažno zastupljena u reprezentacijama audio enkodera modela.
Prediktor radi pre generisanja
Na osnovu tih reprezentacija autori prave lagani prediktor koji koristi zamrznuti audio enkoder i klasifikuje pouzdanost pre nego što model generiše odgovor.
Prediktor je ostvario 81,10% macro-F1 u domenu i 78,09% cross-domain, što autori navode kao poboljšanje od 10,33 i 11,93 poena u odnosu na najjače baseline metode.
Rad dodatno pokazuje da se labele pouzdanosti mogu prenositi između različitih audio LLM porodica, uz performanse povezane sa poravnanjem njihovih granica pouzdanosti.
Izvori
Prikazani su izvorni linkovi korišćeni za proveru objavljenih činjenica.
