Semantic Segmentation on COCO Stuff (val)
63.3mIoUDINO2-L14 + LILA
Evaluation Results
| Method | Links | |||||||
|---|---|---|---|---|---|---|---|---|
| DINO2-L14 + LILATrain Data=+ Kinetics, Backbone=L142026.04 | 63.3 | 81.4 | — | — | — | — | — | |
| DINO2-L14 + LILATrain Data=+ YT-VOS, Backbone=L142026.04 | 62.8 | 81.1 | — | — | — | — | — | |
| UPLiFTParams (M)=0.8, Time (ms)=79.4, Upsampling mode=pixel-dense, Backbone=DINOv2-S/142026.01 | 62.55 | 81.57 | — | — | — | — | — | |
| DINO2-B14 + LILATrain Data=+ YT-VOS, Backbone=B142026.04 | 62.4 | 81.2 | — | — | — | — | — | |
| LoftUpParams (M)=4.3, Time (ms)=223.5, Upsampling mode=pixel-dense, Backbone=DINOv2-S/142026.01 | 62.19 | 81.35 | — | — | — | — | — | |
| AnyUpParams (M)=0.9, Time (ms)=146.7, Upsampling mode=pixel-dense, Backbone=DINOv2-S/142026.01 | 62.08 | 81.31 | — | — | — | — | — | |
| FeatUpParams (M)=0.2, Time (ms)=109.6, Upsampling mode=pixel-dense, Backbone=DINOv2-S/142026.01 | 61.77 | 80.99 | — | — | — | — | — | |
| JAFARParams (M)=0.7, Time (ms)=111.7, Upsampling mode=pixel-dense, Backbone=DINOv2-S/142026.01 | 61.71 | 81.01 | — | — | — | — | — | |
| DINO2-B14 + FlowFeatTrain Data=+ Kinetics, Backbone=B142026.04 | 60.4 | 79.8 | — | — | — | — | — | |
| DINO2-S14 + LILATrain Data=+ YT-VOS, Backbone=S142026.04 | 59.6 | 79.8 | — | — | — | — | — | |
| BilinearTime (ms)=2.8, Upsampling mode=pixel-dense, Backbone=DINOv2-S/142026.01 | 59.41 | 79.28 | — | — | — | — | — | |
| DINO2-L14Train Data=LVD*, Backbone=L142026.04 | 58.7 | 78.1 | — | — | — | — | — | |
| DINO2-B14Train Data=LVD*, Backbone=B142026.04 | 58.5 | 78.2 | — | — | — | — | — | |
| LiFT-2×Params (M)=1.2, Time (ms)=3.8, Upsampling mode=2× upsampling + bilinear, Backbone=DINOv2-S/142026.01 | 58.28 | 78.97 | — | — | — | — | — | |
| DINO2-S14 + FlowFeatTrain Data=+ YT-VOS, Backbone=S142026.04 | 58 | 78.7 | — | — | — | — | — | |
| LiFTParams (M)=1.2, Time (ms)=51.9, Upsampling mode=pixel-dense, Backbone=DINOv2-S/142026.01 | 57.42 | 78.46 | — | — | — | — | — | |
| DINO2-S14Train Data=LVD*, Backbone=S142026.04 | 56.6 | 77.2 | — | — | — | — | — | |
| NearestTime (ms)=0.6, Upsampling mode=pixel-dense, Backbone=DINOv2-S/142026.01 | 56.41 | 77.11 | — | — | — | — | — | |
| LeopartTraining Data=ImageNet + COCO, Evaluation Protocol=Linear Classification (LC)2022.04 | 53.5 | — | — | — | — | — | — | |
| CrOCBackbone=ViT-S/16, Pre-training Dataset=ImageNet2023.03 | 52.6 | — | — | — | — | — | — | |
| CrOCBackbone=ViT-S/16, Pre-training Dataset=COCO+2023.03 | 51.7 | — | — | — | — | — | — | |
| LeopartTraining Data=ImageNet, Evaluation Protocol=Linear Classification (LC)2022.04 | 51.2 | — | — | — | — | — | — | |
| Mask2FormerBackbone=Swin-L, Supervision=M2024.03 | 50.6 | — | — | — | — | — | — | |
| CrOCBackbone=ViT-S/16, Pre-training Dataset=COCO2023.03 | 49.7 | — | — | — | — | — | — | |
| Sup. ViTTraining Data=ImageNet + ImageNet21k, Evaluation Protocol=Linear Classification (LC)2022.04 | 49 | — | — | — | — | — | — | |
| VICRegLBackbone=ResNet50, Pre-training Dataset=ImageNet2023.03 | 48.2 | — | — | — | — | — | — | |
| Full DatasetDistillation Ratio=100%, Backbone=Swin-S2026.05 | 48.19 | — | — | — | — | — | — | |
| DINOTraining Data=ImageNet, Evaluation Protocol=Linear Classification (LC)2022.04 | 47.7 | — | — | — | — | — | — | |
| DenseCLBackbone=ResNet50, Pre-training Dataset=ImageNet2023.03 | 47.5 | — | — | — | — | — | — | |
| Full DatasetDistillation Ratio=100%, Backbone=Swin-T2026.05 | 46.69 | — | — | — | — | — | — | |
| ReSimBackbone=ResNet50, Pre-training Dataset=ImageNet2023.03 | 46.5 | — | — | — | — | — | — | |
| CP2Backbone=ViT-S/16, Pre-training Dataset=ImageNet + PVOC122023.03 | 46.5 | — | — | — | — | — | — | |
| DINOBackbone=ViT-S/16, Pre-training Dataset=COCO2023.03 | 46.2 | — | — | — | — | — | — | |
| SwAVTraining Data=ImageNet, Evaluation Protocol=Linear Classification (LC)2022.04 | 46 | — | — | — | — | — | — | |
| PixProBackbone=ResNet50, Pre-training Dataset=ImageNet2023.03 | 45.9 | — | — | — | — | — | — | |
| Full tuningTuning Protocol=Traditional, Params. (M)=85.802024.03 | 45.89 | — | — | — | — | — | — | |
| DyT† N = 4Tuning Protocol=Dynamic Tuning, Params. (M)=4.802024.03 | 45.71 | — | — | — | — | — | — | |
| DyTTuning Protocol=Dynamic Tuning, Params. (M)=1.192024.03 | 45.63 | — | — | — | — | — | — | |
| ORLBackbone=ResNet50, Pre-training Dataset=COCO+2023.03 | 45.6 | — | — | — | — | — | — | |
| LoRATuning Protocol=Parameter-efficient tuning, Params. (M)=1.192024.03 | 45.53 | — | — | — | — | — | — | |
| AdaptFormerTuning Protocol=Parameter-efficient tuning, Params. (M)=1.192024.03 | 45.33 | — | — | — | — | — | — | |
| Dynamic-FullTuning Protocol=Traditional, Params. (M)=85.802024.03 | 45.2 | — | — | — | — | — | — | |
| VPTTuning Protocol=Parameter-efficient tuning, Params. (M)=0.072024.03 | 44.87 | — | — | — | — | — | — | |
| Sup. ResNetTraining Data=ImageNet, Evaluation Protocol=Linear Classification (LC)2022.04 | 44.4 | — | — | — | — | — | — | |
| SoCoBackbone=ResNet50, Pre-training Dataset=ImageNet2023.03 | 44.2 | — | — | — | — | — | — | |
| DeepLabv3+Backbone=ResNet-101, Supervision=M2024.03 | 44.2 | — | — | — | — | — | — | |
| LinearTuning Protocol=Traditional, Params. (M)=02024.03 | 44.16 | — | — | — | — | — | — | |
| LeopartTraining Data=ImageNet, Evaluation Protocol=Overclustering (K=500)2022.04 | 43.8 | — | — | — | — | — | — | |
| LeopartTraining Data=ImageNet + COCO, Evaluation Protocol=Overclustering (K=500)2022.04 | 43.6 | — | — | — | — | — | — | |
| DHRBackbone=Swin-L, Supervision=I2024.03 | 41.1 | — | — | — | — | — | — | |
| DenseCLTraining Data=ImageNet, Evaluation Protocol=Linear Classification (LC)2022.04 | 40.9 | — | — | — | — | — | — | |
| BYOLBackbone=ResNet50, Pre-training Dataset=COCO+2023.03 | 39.8 | — | — | — | — | — | — | |
| MAEBackbone=ViT-S/16, Pre-training Dataset=COCO2023.03 | 39.6 | — | — | — | — | — | — | |
| DHRBackbone=ResNet-101, Supervision=I2024.03 | 37.4 | — | — | — | — | — | — | |
| MARSBackbone=ResNet-101, Supervision=I2024.03 | 35.7 | — | — | — | — | — | — | |
| D3S2Distillation Ratio=1%, Backbone=Swin-S2026.05 | 35.49 | — | — | — | — | — | — | |
| Sup. ViTTraining Data=ImageNet + ImageNet21k, Evaluation Protocol=Overclustering (K=500)2022.04 | 35.1 | — | — | — | — | — | — | |
| SwAVTraining Data=ImageNet, Evaluation Protocol=Overclustering (K=500)2022.04 | 33.1 | — | — | — | — | — | — | |
| PSPNet50backbone=ResNet50, FPS=6.6, resolution=640x6402020.04 | 32.6 | — | — | — | — | — | — | |
| ReCo+Evaluation Protocol=Unsupervised adaptation2022.06 | 32.6 | 54.1 | — | — | — | — | — | |
| MoCo-v2Training Data=ImageNet, Evaluation Protocol=Linear Classification (LC)2022.04 | 32.6 | — | — | — | — | — | — | |
| HerdingDistillation Ratio=1%, Backbone=Swin-S2026.05 | 32.5 | — | — | — | — | — | — | |
| UniformDistillation Ratio=1%, Backbone=Swin-S2026.05 | 32.46 | — | — | — | — | — | — | |
| DINOTraining Data=ImageNet, Evaluation Protocol=Overclustering (K=500)2022.04 | 32.1 | — | — | — | — | — | — | |
| MaskContrastTraining Data=ImageNet + Pascal VOC, Evaluation Protocol=Linear Classification (LC)2022.04 | 32 | — | — | — | — | — | — | |
| BiSeNetBaseModel=Res1012018.08 | 31.3 | 65.5 | — | — | — | — | — | |
| D3S2Distillation Ratio=1%, Backbone=Swin-T2026.05 | 31.19 | — | — | — | — | — | — | |
| Sup. ResNetTraining Data=ImageNet, Evaluation Protocol=Overclustering (K=500)2022.04 | 30.8 | — | — | — | — | — | — | |
| D3S2Distillation Ratio=0.5%, Backbone=Swin-S2026.05 | 30.66 | — | — | — | — | — | — | |
| DenseCLTraining Data=ImageNet, Evaluation Protocol=Overclustering (K=500)2022.04 | 30.3 | — | — | — | — | — | — | |
| K-CenterDistillation Ratio=1%, Backbone=Swin-S2026.05 | 30.19 | — | — | — | — | — | — | |
| RandomDistillation Ratio=1%, Backbone=Swin-S2026.05 | 29.79 | — | — | — | — | — | — | |
| ICNetbackbone=PSPNet50, FPS=35.7, resolution=640x6402020.04 | 29.1 | — | — | — | — | — | — | |
| HerdingDistillation Ratio=1%, Backbone=Swin-T2026.05 | 28.98 | — | — | — | — | — | — | |
| UniformDistillation Ratio=1%, Backbone=Swin-T2026.05 | 28.96 | — | — | — | — | — | — | |
| BiSeNet V2-Lbackbone=none (ImageNet pre-trained: false), FPS=42.5, resolution=640x6402020.04 | 28.7 | 63.5 | — | — | — | — | — | |
| MoCo-v2Training Data=ImageNet, Evaluation Protocol=Overclustering (K=500)2022.04 | 28.3 | — | — | — | — | — | — | |
| STEGOEvaluation Protocol=Unsupervised adaptation2022.06 | 28.2 | 56.9 | — | — | — | — | — | |
| BiSeNetBaseModel=Res182018.08 | 28.1 | 63.2 | — | — | — | — | — | |
| FreeDaSupporting Dataset=COCO Captions, Extra-Training=false, Fair=false2024.11 | 27.8 | — | — | — | — | — | — | |
| UniformDistillation Ratio=0.5%, Backbone=Swin-S2026.05 | 27.54 | — | — | — | — | — | — | |
| FCN-8Sbackbone=VGG16, resolution=640x6402020.04 | 27.2 | 60.4 | — | — | — | — | — | |
| HerdingDistillation Ratio=0.5%, Backbone=Swin-S2026.05 | 27.14 | — | — | — | — | — | — | |
| Deeplabbackbone=VGG16, FPS=8.1, resolution=640x6402020.04 | 26.9 | 57.8 | — | — | — | — | — | |
| D3S2Distillation Ratio=0.25%, Backbone=Swin-S2026.05 | 26.87 | — | — | — | — | — | — | |
| CASSSupporting Dataset=None, Extra-Training=false, Fair=true2024.11 | 26.7 | — | — | — | — | — | — | |
| RandomDistillation Ratio=1%, Backbone=Swin-T2026.05 | 26.43 | — | — | — | — | — | — | |
| ReCoPublication=NeurIPS'22, Setting=C-USS, context_elimination=true2024.08 | 26.3 | — | — | — | — | — | — | |
| ReCoEvaluation Protocol=Zero-shot transfer2022.06 | 26.3 | 46.1 | — | — | — | — | — | |
| K-CenterDistillation Ratio=1%, Backbone=Swin-T2026.05 | 26.3 | — | — | — | — | — | — | |
| ProxyCLIPSupporting Dataset=None, Extra-Training=false, Fair=true2024.11 | 26.2 | — | — | — | — | — | — | |
| D3S2Distillation Ratio=0.5%, Backbone=Swin-T2026.05 | 26.16 | — | — | — | — | — | — | |
| MaskContrastTraining Data=ImageNet + Pascal VOC, Evaluation Protocol=Overclustering (K=500)2022.04 | 25.6 | — | — | — | — | — | — | |
| BiSeNet V2backbone=none (ImageNet pre-trained: false), FPS=87.9, resolution=640x6402020.04 | 25.2 | 60.5 | — | — | — | — | — | |
| FOSSILSupporting Dataset=COCO Captions, Extra-Training=false, Fair=false2024.11 | 24.8 | — | — | — | — | — | — | |
| RandomDistillation Ratio=0.5%, Backbone=Swin-S2026.05 | 24.75 | — | — | — | — | — | — | |
| CLIP-DINOiserSupporting Dataset=ImageNet1k, Extra-Training=true, Fair=false2024.11 | 24.6 | — | — | — | — | — | — | |
| K-CenterDistillation Ratio=0.5%, Backbone=Swin-S2026.05 | 24.58 | — | — | — | — | — | — | |
| SynSegPublication=ICME 2026, Training Datasets=CC12M2025.08 | 24.5 | — | — | — | — | — | — | |
| Deeplab-v2BaseModel=VGG-162018.08 | 24 | 58.2 | — | — | — | — | — |