ProCAP pokušava da učini vision-language prompt learning stabilnijim sa malo označenih primera
Metod uvodi probabilističke prompt tokene i cross-attention vezu između slike i teksta, dok CLIP backbone ostaje zamrznut.

Problem low-shot režima
Autori navode da prompt learning menja samo mali broj parametara uz zamrznut backbone, ali da mnogi multimodalni prompt learneri slabo povezuju vizuelnu i tekstualnu granu i mogu biti nestabilni kada ima malo označenih primera.
ProCAP prompt tokene opisuje Gaussovim sredinama i varijansama i dodaje lagane KL i L2 regularizacione termine da smanji overfitting.
Cross-attention i kontrastivno poravnanje
Sistem uključuje i mali simetrični InfoNCE head koji poravnava cross-attended vizuelne osobine sa tekstualnim reprezentacijama klasa u zajedničkom niskodimenzionalnom prostoru.
Na few-shot base-to-novel evaluaciji kroz 11 skupova, cross-dataset transferu i ImageNet domain-shift testovima autori prijavljuju snažne agregatne rezultate bez menjanja CLIP backbone-a.
Izvori
Prikazani su izvorni linkovi korišćeni za proveru objavljenih činjenica.
