Semantic Segmentation on Dv 19-class (val)
54.3ACDC-19 ScoreS2-Corr
Evaluation Results
| Method | Links | ||||
|---|---|---|---|---|---|
| S2-CorrBackbone=EVA02 ViT-L/14, Training Data=CS-72026.02 | 54.3 | 53.1 | 60 | 55.8 | |
| S2-CorrBackbone=EVA02 ViT-L/14, Training Data=CS-72026.02 | 54.3 | 53.1 | 60 | 55.8 | |
| CLIPSelfBackbone=EVA02 ViT-L/14, Training Data=CS-7+COCO2026.02 | 51.1 | 53 | 55.7 | 53.3 | |
| CLIPSelfBackbone=EVA02 ViT-L/14, Training Data=CS-7+CoCo2026.02 | 51.1 | 53 | 55.7 | 53.3 | |
| RSC-CLIPSelfBackbone=EVA02 ViT-L/14, Training Data=CS-7+CoCo2026.02 | 50.7 | 50 | 55.7 | 52.1 | |
| CAT-Seg+DGInStyleBackbone=EVA02 ViT-L/14, Training Data=CS-72026.02 | 50.4 | 51.7 | 50.4 | 50.8 | |
| CAT-Seg+DGInStyleBackbone=EVA02 ViT-L/14, Training Data=CS-72026.02 | 50.4 | 51.7 | 50.4 | 50.8 | |
| CAT-SegBackbone=EVA02 ViT-L/14, Training Data=CS-72026.02 | 48.5 | 48.5 | 50.8 | 49.3 | |
| CAT-SegBackbone=EVA02 ViT-L/14, Training Data=CS-72026.02 | 48.5 | 48.5 | 50.8 | 49.3 | |
| MaskAdapterBackbone=EVA02 ViT-L/14, Training Data=CS-72026.02 | 48.1 | 49.4 | 54.6 | 50.7 | |
| MaskAdapterBackbone=EVA02 ViT-L/14, Training Data=CS-72026.02 | 48.1 | 49.4 | 54.6 | 50.7 | |
| MAFT+Backbone=EVA02 ViT-L/14, Training Data=CS-72026.02 | 47.4 | 46.4 | 54.9 | 49.6 | |
| SANBackbone=EVA02 ViT-L/14, Training Data=CS-72026.02 | 46.6 | 47 | 48.3 | 47.3 | |
| ESC-NetBackbone=EVA02 ViT-L/14, Training Data=CS-72026.02 | 46.3 | 47.9 | 53 | 49.1 | |
| CAT-Seg+AdvStyleBackbone=EVA02 ViT-L/14, Training Data=CS-72026.02 | 45.1 | 48 | 49 | 47.4 | |
| S2-CorrBackbone=EVA02 ViT-B/16, Training Data=CS-72026.02 | 44.6 | 50.1 | 56.2 | 50.3 | |
| S2-CorrBackbone=EVA02 ViT-L/14, Training Data=GTA-72026.02 | 44.2 | 50.3 | 53.3 | 49.9 | |
| CAT-Seg+DGInStyleBackbone=EVA02 ViT-L/14, Training Data=GTA-72026.02 | 43.9 | 48.9 | 51 | 47.9 | |
| CLIPSelfBackbone=EVA02 ViT-B/16, Training Data=CS-7+COCO2026.02 | 43.6 | 45.6 | 47.9 | 45.7 | |
| CLIPSelfBackbone=EVA02 ViT-L/14, Training Data=GTA-7+CoCo2026.02 | 43.1 | 50 | 50.1 | 47.7 | |
| RSC-CLIPSelfBackbone=EVA02 ViT-L/14, Training Data=GTA-7+CoCo2026.02 | 42.6 | 49.7 | 51.9 | 48 | |
| CAT-Seg+DGInStyleBackbone=EVA02 ViT-B/16, Training Data=CS-72026.02 | 42.5 | 49.8 | 49.4 | 44.6 | |
| CAT-SegBackbone=EVA02 ViT-L/14, Training Data=GTA-72026.02 | 42.4 | 47.9 | 50.8 | 47.5 | |
| OVSegBackbone=EVA02 ViT-L/14, Training Data=CS-72026.02 | 41.9 | 42.6 | 43.9 | 42.8 | |
| RSC-CLIPSelfBackbone=EVA02 ViT-B/16, Training Data=CS-7+COCO2026.02 | 41.5 | 46.3 | 50.2 | 46 | |
| ESC-NetBackbone=EVA02 ViT-L/14, Training Data=GTA-72026.02 | 41.1 | 45.8 | 51 | 46.3 | |
| CAT-Seg+AdvStyleBackbone=EVA02 ViT-L/14, Training Data=GTA-72026.02 | 41 | 46.3 | 50.6 | 46 | |
| MAFT+Backbone=EVA02 ViT-B/16, Training Data=CS-72026.02 | 40.4 | 43.5 | 50.2 | 44.7 | |
| ESC-NetBackbone=EVA02 ViT-B/16, Training Data=CS-72026.02 | 40.4 | 43.6 | 45.9 | 43.3 | |
| MaskAdapterBackbone=EVA02 ViT-L/14, Training Data=GTA-72026.02 | 40.4 | 47.2 | 50.4 | 46.5 | |
| MAFT+Backbone=EVA02 ViT-L/14, Training Data=GTA-72026.02 | 39.4 | 45.6 | 49.3 | 45.2 | |
| SANBackbone=EVA02 ViT-L/14, Training Data=GTA-72026.02 | 39.1 | 46.6 | 47.7 | 44.1 | |
| CAT-SegBackbone=EVA02 ViT-B/16, Training Data=CS-72026.02 | 38.9 | 44 | 47.6 | 43.5 | |
| MaskAdapterBackbone=EVA02 ViT-B/16, Training Data=CS-72026.02 | 38.9 | 47.7 | 49.9 | 45.5 | |
| SANBackbone=EVA02 ViT-B/16, Training Data=CS-72026.02 | 37.6 | 39.4 | 44 | 40.3 | |
| CAT-Seg+AdvStyleBackbone=EVA02 ViT-B/16, Training Data=CS-72026.02 | 37.2 | 43.2 | 44.6 | 41.7 | |
| OVSegBackbone=EVA02 ViT-L/14, Training Data=GTA-72026.02 | 37 | 43.7 | 44.4 | 41.9 | |
| OVSegBackbone=EVA02 ViT-B/16, Training Data=CS-72026.02 | 36.6 | 40.9 | 45.8 | 41.1 | |
| DeCLIPBackbone=EVA02+DINOV2 ViT-L, Training Data=COCO2026.02 | 32.1 | 31.8 | 38.1 | 34 | |
| ProxyCLIPBackbone=EVA02+SAM ViT-L, Training Data=Training-Free2026.02 | 31 | 38.2 | 40 | 36.4 | |
| ProxyCLIPBackbone=CLIP+SAM ViT-L/14, Training Data=Training-Free2026.02 | 31 | 38.2 | 40 | 36.4 | |
| CAT-SegBackbone=EVA02 ViT-L/14, Training Data=COCO2026.02 | 30.3 | 31.9 | 36.1 | 32.8 | |
| ClearCLIPBackbone=EVA02 ViT-L, Training Data=Training-Free2026.02 | 26.7 | 28.3 | 27 | 27.3 | |
| ClearCLIPBackbone=CLIP ViT-L/14, Training Data=Training-Free2026.02 | 26.7 | 28.3 | 27 | 27.3 | |
| CLIP-DINOiserBackbone=EVA02+DINOV2 ViT-L, Training Data=Training-Free2026.02 | 25.3 | 28.5 | 27.7 | 27.2 | |
| CLIP-DINOiserBackbone=CLIP+DinoV2 ViT-L/14, Training Data=Training-Free2026.02 | 25.3 | 28.5 | 27.7 | 27.2 |