Studija testira pseudo-labeling za prepoznavanje govora u bučnoj policijskoj radio-komunikaciji
Istraživači ispituju kako Whisper i Qwen3-ASR mogu da se prilagode veoma bučnim policijskim radio-snimcima iz Baltimora i Čikaga koristeći pseudo-labele i dodatno filtriranje transkripata.

Foundation ASR modeli imaju problem sa bučnim radio-snimcima
Rad sistematski ispituje mogućnosti i ograničenja pseudo-labeling pristupa za prilagođavanje Whisper i Qwen3-ASR modela noisy Broadcast Police Communication korpusima iz Baltimora i Čikaga.
Autori navode da interni pokazatelji samopouzdanja, uključujući log-verovatnoće i STAR skorove, nisu dobro razdvajali kvalitetne od loših pseudo-transkripata.
LLM evaluator odbacuje kontekstualno neverovatne transkripte
Zbog toga autori uvode spoljni LLM-as-a-judge filter koji koristi parametarsko znanje da odbaci transkripte koji deluju kontekstualno neverovatno.
Prema rezultatima rada, taj filter je agresivniji od internih metrika i značajno smanjuje word error rate pseudo-label skupa za oba posmatrana korpusa, iako i dalje ostaje razlika u odnosu na oracle filter.
Autori dodatno predlažu cross-model pseudo-labeling, gde se jedan model finetunuje pseudo-labelama koje je proizveo drugi.
Izvori
Prikazani su izvorni linkovi korišćeni za proveru objavljenih činjenica.
