Open-vocabulary semantic segmentation on ADE20K (val)
32mIoUT-REN+
Evaluation Results
| Method | Links | |
|---|---|---|
| T-REN+Approach Type=Patch-based vision-language encoder, Backbone=ViT-L, Tokens per image=576, Input Resolution=672p2026.04 | 32 | |
| T-RENApproach Type=Patch-based vision-language encoder, Backbone=ViT-L, Tokens per image=576, Input Resolution=384p2026.04 | 30.6 | |
| RADSeg+Approach Type=SAM-guided, Backbone=ViT-H, Input Resolution=672p2026.04 | 29.9 | |
| TextRegionApproach Type=SAM-guided, Backbone=ViT-H, Input Resolution=672p2026.04 | 27.3 | |
| TridentApproach Type=SAM-guided, Backbone=ViT-H, Input Resolution=672p2026.04 | 25.6 | |
| DINOv3 dino.txtApproach Type=Patch-based vision-language encoder, Backbone=ViT-L, Tokens per image=5762026.04 | 24.7 | |
| CLIP-DINOisertraining=true2026.07 | 20 | |
| DINOv2 dino.txtApproach Type=Patch-based vision-language encoder, Backbone=ViT-L, Tokens per image=5762026.04 | 19.2 | |
| CLIPixtraining=false2026.07 | 19.1 | |
| ResCLIPtraining=false2026.07 | 18 | |
| PEApproach Type=Patch-based vision-language encoder, Backbone=ViT-L, Tokens per image=5762026.04 | 17.6 | |
| ClearCLIPtraining=false2026.07 | 16.7 | |
| SCLIPtraining=false2026.07 | 16.1 | |
| TCLtraining=true2026.07 | 14.9 | |
| EVA-02-CLIPApproach Type=Patch-based vision-language encoder, Backbone=ViT-L, Tokens per image=5762026.04 | 10.9 | |
| SigLIP-2Approach Type=Patch-based vision-language encoder, Backbone=ViT-L, Tokens per image=5762026.04 | 10.8 | |
| GroupViTtraining=true2026.07 | 9.2 | |
| CLIPApproach Type=Patch-based vision-language encoder, Backbone=ViT-L, Tokens per image=5762026.04 | 6 | |
| CLIPtraining=false2026.07 | 2.9 |