Semantic Segmentation on Pascal VOC (default split)
90.9mIoUDINOv3 + SpatialBoost
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| DINOv3 + SpatialBoostevaluation_protocol=multi-scale evaluation2026.03 | 90.9 | — | |
| RADSeg+Model Size=Huge, Resolution=Mid2025.11 | 90.44 | — | |
| RADSeg+Model Scale=Huge, Resolution Limit=≤ Mid Resolution, Zero-shot=true2025.11 | 90.44 | — | |
| RADSeg+Model Scale=Huge, Resolution Limit=≤ High Resolution, Zero-shot=true2025.11 | 90.44 | — | |
| RADSeg+Model Size=Huge, Resolution=Low2025.11 | 90.39 | — | |
| RADSeg+Model Scale=Base, Resolution Limit=≤ High Resolution, Zero-shot=true2025.11 | 90.39 | — | |
| RADSeg+Model Scale=Huge, Resolution Limit=≤ Low Resolution, Zero-shot=true2025.11 | 90.39 | — | |
| RADSeg+Model Size=Base, Resolution=Mid2025.11 | 90.14 | — | |
| RADSeg+Model Scale=Base, Resolution Limit=≤ Mid Resolution, Zero-shot=true2025.11 | 90.14 | — | |
| DINOv3evaluation_protocol=multi-scale evaluation2026.03 | 89.8 | — | |
| RADSegModel Size=Huge, Resolution=Mid2025.11 | 89.74 | — | |
| RADSegModel Scale=Huge, Resolution Limit=≤ Mid Resolution, Zero-shot=true2025.11 | 89.74 | — | |
| RADSegModel Scale=Huge, Resolution Limit=≤ High Resolution, Zero-shot=true2025.11 | 89.74 | — | |
| RADSegModel Size=Huge, Resolution=Low2025.11 | 89.58 | — | |
| RADSegModel Scale=Huge, Resolution Limit=≤ Low Resolution, Zero-shot=true2025.11 | 89.58 | — | |
| TextRegionModel Size=Huge, Resolution=Low2025.11 | 89.53 | — | |
| TextRegionModel Scale=Huge, Resolution Limit=≤ Low Resolution, Zero-shot=true2025.11 | 89.53 | — | |
| TextRegionModel Scale=Huge, Resolution Limit=≤ Mid Resolution, Zero-shot=true2025.11 | 89.53 | — | |
| TextRegionModel Scale=Huge, Resolution Limit=≤ High Resolution, Zero-shot=true2025.11 | 89.53 | — | |
| TextRegionModel Size=Huge, Resolution=Mid2025.11 | 89.42 | — | |
| RADSeg+Model Size=Huge, Resolution=High2025.11 | 89.4 | — | |
| TextRegionModel Size=Huge, Resolution=High2025.11 | 89.36 | — | |
| RADSegModel Size=Base, Resolution=Mid2025.11 | 89.28 | — | |
| RADSegModel Scale=Base, Resolution Limit=≤ Mid Resolution, Zero-shot=true2025.11 | 89.28 | — | |
| RADSegModel Scale=Base, Resolution Limit=≤ High Resolution, Zero-shot=true2025.11 | 89.28 | — | |
| TridentModel Size=Huge, Resolution=Mid2025.11 | 88.67 | — | |
| TridentModel Scale=Huge, Resolution Limit=≤ Mid Resolution, Zero-shot=true2025.11 | 88.67 | — | |
| TridentModel Scale=Huge, Resolution Limit=≤ High Resolution, Zero-shot=true2025.11 | 88.67 | — | |
| RADSegModel Size=Huge, Resolution=High2025.11 | 88.52 | — | |
| DINOv3 + SpatialBoostevaluation_protocol=linear probing2026.03 | 88.5 | — | |
| RADSeg+Model Size=Base, Resolution=Low2025.11 | 88.46 | — | |
| RADSeg+Model Scale=Base, Resolution Limit=≤ Low Resolution, Zero-shot=true2025.11 | 88.46 | — | |
| DINOv3Size=B2026.07 | 88.2 | — | |
| DINOv3Size=L2026.07 | 88.11 | — | |
| TridentModel Size=Huge, Resolution=Low2025.11 | 87.97 | — | |
| TridentModel Scale=Huge, Resolution Limit=≤ Low Resolution, Zero-shot=true2025.11 | 87.97 | — | |
| SC-CLIPModel Size=Base, Resolution=Mid2025.11 | 87.67 | — | |
| SC-CLIPModel Scale=Base, Resolution Limit=≤ Mid Resolution, Zero-shot=true2025.11 | 87.67 | — | |
| SC-CLIPModel Scale=Base, Resolution Limit=≤ High Resolution, Zero-shot=true2025.11 | 87.67 | — | |
| DINOv2 + SpatialBoostevaluation_protocol=multi-scale evaluation2026.03 | 87.6 | — | |
| LingBot-VisionSize=L2026.07 | 87.4 | — | |
| RADSegModel Size=Base, Resolution=Low2025.11 | 87.24 | — | |
| RADSegModel Scale=Base, Resolution Limit=≤ Low Resolution, Zero-shot=true2025.11 | 87.24 | — | |
| TridentModel Size=Huge, Resolution=High2025.11 | 87.22 | — | |
| LingBot-VisionSize=B2026.07 | 87.1 | — | |
| TIPSevaluation_protocol=multi-scale evaluation2026.03 | 86.7 | — | |
| V-JEPAv2evaluation_protocol=multi-scale evaluation2026.03 | 86.6 | — | |
| DINOv3evaluation_protocol=linear probing2026.03 | 86.6 | — | |
| dino.txtevaluation_protocol=multi-scale evaluation2026.03 | 86.3 | — | |
| DINOv2evaluation_protocol=multi-scale evaluation2026.03 | 86.2 | — | |
| ResCLIPModel Size=Base, Resolution=Mid2025.11 | 85.89 | — | |
| ResCLIPModel Scale=Base, Resolution Limit=≤ Mid Resolution, Zero-shot=true2025.11 | 85.89 | — | |
| ResCLIPModel Scale=Base, Resolution Limit=≤ High Resolution, Zero-shot=true2025.11 | 85.89 | — | |
| RADSeg+Model Size=Base, Resolution=High2025.11 | 85.7 | — | |
| Talk2DinoModel Size=Base, Resolution=Low2025.11 | 85.68 | — | |
| Talk2DinoModel Scale=Base, Resolution Limit=≤ Low Resolution, Zero-shot=true2025.11 | 85.68 | — | |
| Talk2DinoModel Scale=Base, Resolution Limit=≤ Mid Resolution, Zero-shot=true2025.11 | 85.68 | — | |
| Talk2DinoModel Scale=Base, Resolution Limit=≤ High Resolution, Zero-shot=true2025.11 | 85.68 | — | |
| Talk2DinoModel Size=Base, Resolution=Mid2025.11 | 85.66 | — | |
| DINOv2 + UniRefinerViT=G/14, Evaluation Protocol=Linear probing2026.05 | 85.4 | 92.2 | |
| DiveUpV.A. (VFM-agnostic)=true, Backbone=DINOv2-S, Evaluation Protocol=Linear Probing, Refinement stage=false2026.03 | 85.08 | — | |
| RaysUpUpsampling Resolution=32 → 2242026.06 | 84.81 | 96.37 | |
| V-JEPA2.1Size=L2026.07 | 84.81 | — | |
| RaysUpUpsampling Resolution=32 → 1122026.06 | 84.76 | 96.35 | |
| RaysUpUpsampling Resolution=32 → 8962026.06 | 84.67 | 96.35 | |
| RaysUp2026.06 | 84.64 | 96.34 | |
| LoftUpUpsampling Resolution=32 → 2242026.06 | 84.64 | 96.32 | |
| AnyUpUpsampling Resolution=32 → 1122026.06 | 84.64 | 96.31 | |
| AnyUpUpsampling Resolution=32 → 2242026.06 | 84.56 | 96.31 | |
| NAFV.A. (VFM-agnostic)=true, Backbone=DINOv2-S, Evaluation Protocol=Linear Probing, Refinement stage=true2026.03 | 84.52 | — | |
| DINOv2 + SpatialBoostevaluation_protocol=linear probing2026.03 | 84.5 | — | |
| TridentModel Size=Base, Resolution=Mid2025.11 | 84.5 | — | |
| TridentModel Scale=Base, Resolution Limit=≤ Mid Resolution, Zero-shot=true2025.11 | 84.5 | — | |
| TridentModel Scale=Base, Resolution Limit=≤ High Resolution, Zero-shot=true2025.11 | 84.5 | — | |
| LoftUp2026.06 | 84.5 | 96.3 | |
| JAFARUpsampling Resolution=32 → 1122026.06 | 84.49 | 96.27 | |
| LoftUpUpsampling Resolution=32 → 8962026.06 | 84.45 | 96.3 | |
| FrancaSize=L2026.07 | 84.42 | — | |
| LoftUpUpsampling Resolution=32 → 1122026.06 | 84.41 | 96.28 | |
| JAFARUpsampling Resolution=32 → 2242026.06 | 84.4 | 96.25 | |
| DINOv3Size=S2026.07 | 84.3 | — | |
| SC-CLIPModel Size=Base, Resolution=Low2025.11 | 84.29 | — | |
| SC-CLIPModel Scale=Base, Resolution Limit=≤ Low Resolution, Zero-shot=true2025.11 | 84.29 | — | |
| JAFARV.A. (VFM-agnostic)=false, Backbone=DINOv2-S, Evaluation Protocol=Linear Probing, Refinement stage=false2026.03 | 84.24 | — | |
| TextRegionModel Size=Base, Resolution=Mid2025.11 | 84.21 | — | |
| TextRegionModel Scale=Base, Resolution Limit=≤ Mid Resolution, Zero-shot=true2025.11 | 84.21 | — | |
| TextRegionModel Scale=Base, Resolution Limit=≤ High Resolution, Zero-shot=true2025.11 | 84.21 | — | |
| DINOv2ViT=G/14, Evaluation Protocol=Linear probing2026.05 | 84.2 | 90.7 | |
| AnyUp2026.06 | 84.18 | 96.2 | |
| LingBot-VisionSize=S2026.07 | 84.17 | — | |
| Talk2DinoModel Size=Base, Resolution=High2025.11 | 84.15 | — | |
| AnyUpUpsampling Resolution=32 → 8962026.06 | 84.08 | 96.16 | |
| RADSegModel Size=Base, Resolution=High2025.11 | 84.07 | — | |
| JAFAR2026.06 | 83.89 | 96.11 | |
| AnyUp-SV.A. (VFM-agnostic)=true, Backbone=DINOv2-S, Evaluation Protocol=Linear Probing, Refinement stage=false2026.03 | 83.85 | — | |
| TextRegionModel Size=Base, Resolution=Low2025.11 | 83.83 | — | |
| TextRegionModel Scale=Base, Resolution Limit=≤ Low Resolution, Zero-shot=true2025.11 | 83.83 | — | |
| DINOv2Size=B2026.07 | 83.81 | — | |
| TC-JEPAViT=H/14, Protocol=FT2026.05 | 83.8 | — | |
| TridentModel Size=Base, Resolution=Low2025.11 | 83.74 | — |