ProCAP pokušava da učini vision-language prompt learning stabilnijim sa malo označenih primera

Metod uvodi probabilističke prompt tokene i cross-attention vezu između slike i teksta, dok CLIP backbone ostaje zamrznut.

Problem low-shot režima

Autori navode da prompt learning menja samo mali broj parametara uz zamrznut backbone, ali da mnogi multimodalni prompt learneri slabo povezuju vizuelnu i tekstualnu granu i mogu biti nestabilni kada ima malo označenih primera.

ProCAP prompt tokene opisuje Gaussovim sredinama i varijansama i dodaje lagane KL i L2 regularizacione termine da smanji overfitting.

Cross-attention i kontrastivno poravnanje

Sistem uključuje i mali simetrični InfoNCE head koji poravnava cross-attended vizuelne osobine sa tekstualnim reprezentacijama klasa u zajedničkom niskodimenzionalnom prostoru.

Na few-shot base-to-novel evaluaciji kroz 11 skupova, cross-dataset transferu i ImageNet domain-shift testovima autori prijavljuju snažne agregatne rezultate bez menjanja CLIP backbone-a.

Izvori

Prikazani su izvorni linkovi korišćeni za proveru objavljenih činjenica.