Semantic Segmentation on Pascal Context 60
4,630mIoUCLIPer + ARM
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| CLIPer + ARMBackbone=ViT-L/14, Zero-shot=true2025.12 | 4,630 | — | |
| CLIPer + ARMBackbone=ViT-B/16, Zero-shot=true2025.12 | 4,560 | — | |
| SCLIP + ARMBackbone=ViT-B/16, Zero-shot=true2025.12 | 4,530 | — | |
| CorrCLIPBackbone=ViT-L/14, Zero-shot=true2025.12 | 4,490 | — | |
| CorrCLIPBackbone=ViT-B/16, Zero-shot=true2025.12 | 4,420 | — | |
| SCLIP + ARMBackbone=ViT-L/14, Zero-shot=true2025.12 | 4,290 | — | |
| CLIPerBackbone=ViT-L/14, Zero-shot=true2025.12 | 3,800 | — | |
| CLIPerBackbone=ViT-B/16, Zero-shot=true2025.12 | 3,760 | — | |
| NACLIPBackbone=ViT-B/16, Zero-shot=true2025.12 | 3,500 | — | |
| SCLIPBackbone=ViT-B/16, Zero-shot=true2025.12 | 3,420 | — | |
| ResCLIPBackbone=ViT-B/16, Zero-shot=true2025.12 | 3,350 | — | |
| ClearCLIPBackbone=ViT-B/16, Zero-shot=true2025.12 | 3,260 | — | |
| ResCLIPBackbone=ViT-L/14, Zero-shot=true2025.12 | 3,090 | — | |
| ClearCLIPBackbone=ViT-L/14, Zero-shot=true2025.12 | 2,670 | — | |
| MaskCLIPBackbone=ViT-B/16, Zero-shot=true2025.12 | 2,360 | — | |
| SCLIPBackbone=ViT-L/14, Zero-shot=true2025.12 | 2,230 | — | |
| MaskCLIPBackbone=ViT-L/14, Zero-shot=true2025.12 | 1,170 | — | |
| CLIPBackbone=ViT-B/16, Zero-shot=true2025.12 | 840 | — | |
| CLIPBackbone=ViT-L/14, Zero-shot=true2025.12 | 410 | — | |
| SANetBackbone=EffNet-b72019.09 | 54.4 | — | |
| SANetBackbone=ResNet1012019.09 | 52.1 | — | |
| EncNetBackbone=ResNet1012019.09 | 51.7 | — | |
| RefineNetBackbone=ResNet1522019.09 | 47.3 | — | |
| Deeplab-v2Backbone=ResNet1012019.09 | 45.7 | — | |
| CorrCLIPSize=ViT-L/14, Training Approach=Training-free2024.11 | 44.9 | — | |
| CorrCLIPSize=ViT-B/16, Training Approach=Training-free2024.11 | 44.2 | — | |
| CorrCLIPBackbone=ViT-B/16, VLM Source=MetaCLIP2026.04 | 44.2 | — | |
| OV-StitcherBackbone=ViT-B/16, VLM Source=OpenAI CLIP, post-processing=true2026.04 | 43.9 | — | |
| OV-StitcherBackbone=ViT-B/16, VLM Source=MetaCLIP2026.04 | 43.9 | — | |
| OV-StitcherBackbone=ViT-L/14, VLM Source=OpenAI CLIP2026.04 | 43.4 | — | |
| Piecewise2019.09 | 43.3 | — | |
| CorrCLIPSize=ViT-H/14, Training Approach=Training-free2024.11 | 42.5 | — | |
| OV-StitcherBackbone=ViT-B/16, VLM Source=OpenAI CLIP, post-processing=false2026.04 | 42.4 | — | |
| CorrCLIPBackbone=ViT-L/14, VLM Source=OpenAI CLIP2026.04 | 42.2 | — | |
| CorrCLIPBackbone=ViT-B/16, VLM Source=OpenAI CLIP, post-processing=true2026.04 | 41.6 | — | |
| HighOrder-CRF2019.09 | 41.3 | — | |
| BoxSup2019.09 | 40.5 | — | |
| ParseNet2019.09 | 40.4 | — | |
| TridentSize=ViT-H/14, Training Approach=Training-free2024.11 | 40.1 | — | |
| CorrCLIPBackbone=ViT-B/16, VLM Source=OpenAI CLIP, post-processing=false2026.04 | 40 | — | |
| TridentBackbone=ViT-B/16, VLM Source=MetaCLIP2026.04 | 39.9 | — | |
| CRF-RNN2019.09 | 39.3 | — | |
| DSLO (solve maximum velocity)Logits Model=CLIP ViT-L/142026.04 | 38.7 | — | |
| TridentSize=ViT-B/16, Training Approach=Training-free2024.11 | 38.6 | — | |
| TridentBackbone=ViT-B/16, VLM Source=OpenAI CLIP2026.04 | 38.6 | — | |
| FreeDASize=ViT-L/14, Training Approach=Training-free2024.11 | 38.3 | — | |
| DSLO (solve maximum velocity)Logits Model=CLIP ViT-B/162026.04 | 38.3 | — | |
| CLIPerSize=ViT-L/14, Training Approach=Training-free2024.11 | 38 | — | |
| DSLO (solve optimal path)Logits Model=CLIP ViT-L/142026.04 | 37.9 | — | |
| FCN2019.09 | 37.8 | — | |
| CLIPerSize=ViT-B/16, Training Approach=Training-free2024.11 | 37.6 | — | |
| DSLO (solve optimal path)Logits Model=CLIP ViT-B/162026.04 | 37.6 | — | |
| ProxyCLIPBackbone=ViT-B/16, VLM Source=MetaCLIP2026.04 | 37.5 | — | |
| TridentBackbone=ViT-L/14, VLM Source=OpenAI CLIP2026.04 | 37.3 | — | |
| SFPBackbone=ViT-B/16, VLM Source=OpenAI CLIP2026.04 | 37.2 | — | |
| SC-CLIPSize=ViT-L/14, Training Approach=Training-free2024.11 | 36.9 | — | |
| SC-CLIPLogits Model=CLIP ViT-L/14, Paradigm=M.M.2026.04 | 36.9 | — | |
| SC-CLIPBackbone=ViT-L/14, VLM Source=OpenAI CLIP2026.04 | 36.9 | — | |
| SC-CLIPSize=ViT-B/16, Training Approach=Training-free2024.11 | 36.8 | — | |
| SC-CLIPLogits Model=CLIP ViT-B/16, Paradigm=M.M.2026.04 | 36.8 | — | |
| SC-CLIPBackbone=ViT-B/16, VLM Source=OpenAI CLIP2026.04 | 36.8 | — | |
| CASSSize=ViT-B/16, Training Approach=Training-free2024.11 | 36.7 | — | |
| CASSLogits Model=CLIP ViT-B/16, Paradigm=M.M.2026.04 | 36.7 | — | |
| CASSBackbone=ViT-B/16, VLM Source=OpenAI CLIP2026.04 | 36.7 | — | |
| ProxyCLIPSize=ViT-H/14, Training Approach=Training-free2024.11 | 35.4 | — | |
| ProxyCLIPSize=ViT-B/16, Training Approach=Training-free2024.11 | 35.3 | — | |
| ProxyCLIPBackbone=ViT-B/16, VLM Source=OpenAI CLIP2026.04 | 35.3 | — | |
| ProxyCLIP‡Logits Model=CLIP ViT-B/16, Paradigm=M.M.2026.04 | 35.2 | — | |
| NACLIPSize=ViT-B/16, Training Approach=Training-free2024.11 | 35 | — | |
| ProxyCLIPSize=ViT-L/14, Training Approach=Training-free2024.11 | 34.5 | — | |
| ProxyCLIPBackbone=ViT-L/14, VLM Source=OpenAI CLIP2026.04 | 34.5 | — | |
| ProxyCLIP‡Logits Model=CLIP ViT-L/14, Paradigm=M.M.2026.04 | 34.1 | — | |
| ResCLIPSize=ViT-B/16, Training Approach=Training-free2024.11 | 33.5 | — | |
| NACLIP + ResCLIPTraining-free?=true, Encoder=ViT-B/162024.11 | 33.5 | — | |
| ResCLIPBackbone=ViT-B/16, VLM Source=OpenAI CLIP2026.04 | 33.5 | — | |
| SCLIP + ResCLIPTraining-free?=true, Encoder=ViT-B/162024.11 | 32.9 | — | |
| ClearCLIP + ResCLIPTraining-free?=true, Encoder=ViT-B/162024.11 | 32.9 | — | |
| ClearCLIPSize=ViT-B/16, Training Approach=Training-free2024.11 | 32.6 | — | |
| GEMTraining-free?=true, Encoder=ViT-B/162024.11 | 32.6 | — | |
| ClearCLIPTraining-free?=true, Encoder=ViT-B/162024.11 | 32.6 | — | |
| ClearCLIPLogits Model=CLIP ViT-B/16, Paradigm=M.M.2026.04 | 32.6 | — | |
| ClearCLIPBackbone=ViT-B/16, VLM Source=OpenAI CLIP2026.04 | 32.6 | — | |
| CLIP-DINOiserSize=ViT-B/16, Training Approach=Training-based2024.11 | 32.4 | — | |
| CLIP-DINOiser†Logits Model=CLIP ViT-B/16, Paradigm=I.T.2026.04 | 32.4 | — | |
| NACLIPTraining-free?=true, Encoder=ViT-B/162024.11 | 32.2 | — | |
| NACLIPLogits Model=CLIP ViT-B/16, Paradigm=M.M.2026.04 | 32.2 | — | |
| NACLIPBackbone=ViT-B/16, VLM Source=OpenAI CLIP2026.04 | 32.2 | — | |
| GEMLogits Model=CLIP ViT-B/16, Paradigm=I.T.2026.04 | 32 | — | |
| LaVGSize=ViT-B/16, Training Approach=Training-free2024.11 | 31.6 | — | |
| LaVGLogits Model=CLIP ViT-B/16, Paradigm=M.M.2026.04 | 31.6 | — | |
| ResCLIPSize=ViT-L/14, Training Approach=Training-free2024.11 | 30.9 | — | |
| NACLIP + ResCLIPTraining-free?=true, Encoder=ViT-L/142024.11 | 30.9 | — | |
| ResCLIPBackbone=ViT-L/14, VLM Source=OpenAI CLIP2026.04 | 30.9 | — | |
| CLIPtraseSize=ViT-B/16, Training Approach=Training-free2024.11 | 30.8 | — | |
| CoDeSize=ViT-B/16, Training Approach=Training-based2024.11 | 30.5 | — | |
| CaRSize=ViT-L/14, Training Approach=Training-free2024.11 | 30.5 | — | |
| TCLSize=ViT-B/16, Training Approach=Training-based2024.11 | 30.4 | — | |
| SCLIPSize=ViT-B/16, Training Approach=Training-free2024.11 | 30.4 | — | |
| SCLIPTraining-free?=true, Encoder=ViT-B/162024.11 | 30.4 | — | |
| TCLLogits Model=CLIP ViT-B/16, Paradigm=I.T.2026.04 | 30.4 | — |