Unsupervised Open-vocabulary Semantic Segmentation on ADE20K (val)
23.2mIoUFreeDA (ViT-L)
Evaluation Results
| Method | Links | |
|---|---|---|
| FreeDA (ViT-L)PAMR=false, Training Dataset=COCO Captions, Total Parameters (M)=732, Trainable Parameters (M)=0, Similarity=Visual2024.04 | 23.2 | |
| FreeDA (ViT-B)PAMR=false, Training Dataset=COCO Captions, Total Parameters (M)=236.1, Trainable Parameters (M)=0, Similarity=Visual2024.04 | 22.4 | |
| TCLPAMR=true, Training Dataset=CC3M+CC12M, Total Parameters (M)=178.3, Trainable Parameters (M)=21.7, Similarity=Visual2024.04 | 17.1 | |
| TCLPAMR=false, Training Dataset=CC3M+CC12M, Total Parameters (M)=178.3, Trainable Parameters (M)=21.7, Similarity=Textual2024.04 | 14.9 | |
| OVDiffPAMR=false, Total Parameters (M)=1226.4, Trainable Parameters (M)=0, Similarity=Visual2024.04 | 14.9 | |
| ReCoPAMR=true, Training Dataset=ImageNet1k, Total Parameters (M)=313, Trainable Parameters (M)=0, Similarity=Visual2024.04 | 12.4 | |
| ReCoPAMR=false, Training Dataset=ImageNet1k, Total Parameters (M)=313, Trainable Parameters (M)=0, Similarity=Visual2024.04 | 11.2 | |
| MaskCLIPPAMR=false, Total Parameters (M)=291, Trainable Parameters (M)=0, Similarity=Textual2024.04 | 9.8 | |
| GroupViTPAMR=true, Training Dataset=CC12M+YFCC, Total Parameters (M)=55.8, Trainable Parameters (M)=55.8, Similarity=Visual2024.04 | 9.4 | |
| GroupViTPAMR=false, Training Dataset=CC12M+RedCaps, Total Parameters (M)=55.8, Trainable Parameters (M)=55.8, Similarity=Textual2024.04 | 9.2 | |
| MaskCLIPPAMR=true, Total Parameters (M)=291, Trainable Parameters (M)=0, Similarity=Textual2024.04 | 9 |