Unsupervised Open-vocabulary Semantic Segmentation on COCO Stuff (val)
28.8mIoUFreeDA (ViT-L)
Evaluation Results
| Method | Links | |
|---|---|---|
| FreeDA (ViT-L)PAMR=false, Training Dataset=COCO Captions, Total Parameters (M)=732, Trainable Parameters (M)=0, Similarity=Visual2024.04 | 28.8 | |
| FreeDA (ViT-B)PAMR=false, Training Dataset=COCO Captions, Total Parameters (M)=236.1, Trainable Parameters (M)=0, Similarity=Visual2024.04 | 27.8 | |
| TCLPAMR=true, Training Dataset=CC3M+CC12M, Total Parameters (M)=178.3, Trainable Parameters (M)=21.7, Similarity=Visual2024.04 | 22.4 | |
| TCLPAMR=false, Training Dataset=CC3M+CC12M, Total Parameters (M)=178.3, Trainable Parameters (M)=21.7, Similarity=Textual2024.04 | 19.6 | |
| MaskCLIPPAMR=false, Total Parameters (M)=291, Trainable Parameters (M)=0, Similarity=Textual2024.04 | 16.4 | |
| ReCoPAMR=true, Training Dataset=ImageNet1k, Total Parameters (M)=313, Trainable Parameters (M)=0, Similarity=Visual2024.04 | 16.3 | |
| GroupViTPAMR=true, Training Dataset=CC12M+YFCC, Total Parameters (M)=55.8, Trainable Parameters (M)=55.8, Similarity=Visual2024.04 | 15.4 | |
| GroupViTPAMR=false, Training Dataset=CC12M+RedCaps, Total Parameters (M)=55.8, Trainable Parameters (M)=55.8, Similarity=Textual2024.04 | 15.3 | |
| MaskCLIPPAMR=true, Total Parameters (M)=291, Trainable Parameters (M)=0, Similarity=Textual2024.04 | 15.1 | |
| ReCoPAMR=false, Training Dataset=ImageNet1k, Total Parameters (M)=313, Trainable Parameters (M)=0, Similarity=Visual2024.04 | 14.8 |