Open-vocabulary semantic segmentation on ADE20K A-847
20mIoUFG-CLIP 2
Evaluation Results
| Method | Links | |
|---|---|---|
| FG-CLIP 2Backbone=ViT-So/162025.10 | 20 | |
| FG-CLIP 2Backbone=ViT-L/162025.10 | 18.8 | |
| FG-CLIP 2Backbone=ViT-B/162025.10 | 16.6 | |
| UMG-CLIPBackbone=ViT-L/142025.10 | 15.4 | |
| FG-CLIPBackbone=ViT-L/142025.10 | 14.6 | |
| SigLIP 2Backbone=ViT-L/162025.10 | 14.3 | |
| FineCLIPBackbone=ViT-L/142025.10 | 14.1 | |
| UMG-CLIPBackbone=ViT-B/162025.10 | 13.8 | |
| CLIPSelfBackbone=ViT-L/142025.10 | 13.6 | |
| FG-CLIPBackbone=ViT-B/162025.10 | 12.3 | |
| FineCLIPBackbone=ViT-B/162025.10 | 12.2 | |
| HyRoVLM=CLIP ViT-B/16, Fine-tuning Space=H2026.05 | 12 | |
| HyperCLIPVLM=CLIP ViT-B/16, Fine-tuning Space=H2026.05 | 11.9 | |
| SEDVLM=CLIP ConvNeXt-B, Fine-tuning Space=E2026.05 | 11.4 | |
| CLIPBackbone=ViT-L/142025.10 | 10.8 | |
| SigLIP 2Backbone=ViT-B/162025.10 | 10.4 | |
| SANVLM=CLIP ViT-B/16, Additional Backbone=Side Adapter, Fine-tuning Space=E2026.05 | 10.1 | |
| CLIPSelfBackbone=ViT-B/162025.10 | 10.1 | |
| CLIPBackbone=ViT-B/162025.10 | 8.4 | |
| OVSegVLM=CLIP ViT-B/16, Additional Backbone=ResNet-101c, Fine-tuning Space=E2026.05 | 7.1 | |
| ZSsegVLM=CLIP ViT-B/16, Additional Backbone=ResNet-101, Fine-tuning Space=E2026.05 | 7 | |
| ZegFormerVLM=CLIP ViT-B/16, Additional Backbone=ResNet-101, Fine-tuning Space=E2026.05 | 4.9 | |
| OpenSegVLM=ALIGN, Additional Backbone=ResNet-101, Fine-tuning Space=E2026.05 | 4.4 |