Open-Vocabulary Semantic Segmentation on Overall Average 9 datasets
46.9Average IoUOVS-DINO
Evaluation Results
| Method | Links | |
|---|---|---|
| OVS-DINOBackbone=DINOv2 B/142026.04 | 46.9 | |
| DSGSBackbone=CLIP B/162026.04 | 44.8 | |
| Talk2DINOBackbone=DINOv2 B/142026.04 | 43.8 | |
| CLIP-DINOiserBackbone=CLIP B/162026.04 | 40.2 | |
| CLIP-SAMTraining Protocol=Zero-shot, Input Resolution=896x8962026.02 | 38.3 | |
| SegEarth-OVTraining Protocol=Trained on remote sensing data, Input Resolution=896x8962026.02 | 37.4 | |
| TCLBackbone=CLIP B/162026.04 | 33.9 | |
| CoDeBackbone=CLIP B/162026.04 | 30.3 | |
| GroupViTBackbone=CLIP S/162026.04 | 29.4 | |
| ReCoBackbone=CLIP B/162026.04 | 23.5 |