Semantic Segmentation on Stuff
32.1mIoUOV-Stitcher
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| OV-StitcherBackbone=ViT-B/16, VLM Source=MetaCLIP2026.04 | 32.1 | — | |
| OV-StitcherBackbone=ViT-B/16, VLM Source=OpenAI CLIP, post-processing=true2026.04 | 31.8 | — | |
| OV-StitcherBackbone=ViT-L/14, VLM Source=OpenAI CLIP2026.04 | 31.6 | — | |
| CorrCLIPBackbone=ViT-B/16, VLM Source=MetaCLIP2026.04 | 31.6 | — | |
| CorrCLIPBackbone=ViT-L/14, VLM Source=OpenAI CLIP2026.04 | 31 | — | |
| CorrCLIPBackbone=ViT-B/16, VLM Source=OpenAI CLIP, post-processing=true2026.04 | 30.7 | — | |
| OV-StitcherBackbone=ViT-B/16, VLM Source=OpenAI CLIP, post-processing=false2026.04 | 30.7 | — | |
| TridentBackbone=ViT-B/16, VLM Source=MetaCLIP2026.04 | 29.8 | — | |
| CorrCLIPBackbone=ViT-B/16, VLM Source=OpenAI CLIP, post-processing=false2026.04 | 29.6 | — | |
| TridentBackbone=ViT-B/16, VLM Source=OpenAI CLIP2026.04 | 28.3 | — | |
| ProxyCLIPBackbone=ViT-B/16, VLM Source=MetaCLIP2026.04 | 28.1 | — | |
| ProxyCLIP + RAG-OVSVenue=This Paper2025.12 | 27.7 | — | |
| TridentBackbone=ViT-L/14, VLM Source=OpenAI CLIP2026.04 | 27.1 | — | |
| SC-CLIPBackbone=ViT-L/14, VLM Source=OpenAI CLIP2026.04 | 26.9 | — | |
| CASSBackbone=ViT-B/16, VLM Source=OpenAI CLIP2026.04 | 26.7 | — | |
| SC-CLIPBackbone=ViT-B/16, VLM Source=OpenAI CLIP2026.04 | 26.6 | — | |
| ProxyCLIPVenue=ECCV'242025.12 | 26.5 | — | |
| ProxyCLIPBackbone=ViT-B/16, VLM Source=OpenAI CLIP2026.04 | 26.5 | — | |
| SFPBackbone=ViT-B/16, VLM Source=OpenAI CLIP2026.04 | 26.4 | — | |
| NACLIP + RAG-OVSVenue=This Paper2025.12 | 25.7 | — | |
| ProxyCLIPBackbone=ViT-L/14, VLM Source=OpenAI CLIP2026.04 | 25.6 | — | |
| CLIPtrace + RAG-OVSVenue=This Paper2025.12 | 25.1 | — | |
| ResCLIPBackbone=ViT-B/16, VLM Source=OpenAI CLIP2026.04 | 24.7 | — | |
| SCLIP + RAG-OVSVenue=This Paper2025.12 | 24.1 | — | |
| CLIPtraceVenue=ECCV'242025.12 | 24.1 | — | |
| ClearCLIPBackbone=ViT-B/16, VLM Source=OpenAI CLIP2026.04 | 23.9 | — | |
| CLIP-Surgery + RAG-OVSVenue=This Paper2025.12 | 23.6 | — | |
| GroupViTVenue=CVPR'222025.12 | 23.4 | — | |
| ResCLIPBackbone=ViT-L/14, VLM Source=OpenAI CLIP2026.04 | 23.4 | — | |
| NACLIPVenue=WACV'252025.12 | 23.3 | — | |
| NACLIPBackbone=ViT-B/16, VLM Source=OpenAI CLIP2026.04 | 23.3 | — | |
| ClearCLIPBackbone=ViT-B/16, Evaluation Protocol=Zero-shot (no background class)2024.11 | 23.1 | 37.9 | |
| ClearCLIP + ResCLIPBackbone=ViT-B/16, Evaluation Protocol=Zero-shot (no background class)2024.11 | 23.1 | 38.4 | |
| CLIPtraseBackbone=ViT-B/16, VLM Source=OpenAI CLIP2026.04 | 22.8 | — | |
| SCLIPVenue=ECCV'242025.12 | 22.4 | — | |
| SCLIPBackbone=ViT-B/16, VLM Source=OpenAI CLIP2026.04 | 22.4 | — | |
| RecoVenue=NeurIPS'222025.12 | 22.3 | — | |
| NACLIP + ResCLIPBackbone=ViT-B/16, Evaluation Protocol=Zero-shot (no background class)2024.11 | 22.2 | 37.9 | |
| CLIP-SurgeryVenue=Pattern Recognition2025.12 | 22.1 | — | |
| SCLIP + ResCLIPBackbone=ViT-B/16, Evaluation Protocol=Zero-shot (no background class)2024.11 | 21.9 | 35.5 | |
| SCLIPBackbone=ViT-B/16, Evaluation Protocol=Zero-shot (no background class)2024.11 | 21.2 | 33.9 | |
| NACLIPBackbone=ViT-B/16, Evaluation Protocol=Zero-shot (no background class)2024.11 | 20.3 | 35.3 | |
| OVDiffVenue=ECCV'242025.12 | 20.3 | — | |
| MaskCLIPVenue=ECCV'222025.12 | 16.7 | — | |
| MaskCLIPBackbone=ViT-B/16, VLM Source=OpenAI CLIP2026.04 | 16.7 | — | |
| MaskCLIPBackbone=ViT-L/14, VLM Source=OpenAI CLIP2026.04 | 8.8 | — | |
| CLIPBackbone=ViT-B/16, VLM Source=OpenAI CLIP2026.04 | 5.7 | — | |
| OpenCLIPBackbone=ViT-B/16, Evaluation Protocol=Zero-shot (no background class)2024.11 | 5 | 13.84 | |
| CLIPVenue=ICML'212025.12 | 4.4 | — | |
| CLIPBackbone=ViT-L/14, VLM Source=OpenAI CLIP2026.04 | 2.4 | — |