Semantic Segmentation on ADE20K (mIoU, Accm)
60.05mIoUEVA-02-L
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| EVA-02-LRes=640, Img/s=2.552025.10 | 60.05 | — | 86.83 | |
| APTRes=640, Img/s=2.83, Speedup=+11%2025.10 | 60.01 | — | 86.82 | |
| EVA-02-LRes=512, Img/s=4.402025.10 | 59.77 | — | 86.67 | |
| APTRes=512, Img/s=4.87, Speedup=+11%2025.10 | 59.7 | — | 86.68 | |
| ResizingRes=640, Img/s=2.83, Speedup=+11%2025.10 | 58.83 | — | 86.06 | |
| ResizingRes=512, Img/s=4.87, Speedup=+11%2025.10 | 58.81 | — | 86.09 | |
| CPolyNeXt-S♦Params (M)=54, MACs (G)=9412026.05 | 50.6 | — | — | |
| APolyNeXt-S♦Params (M)=55, MACs (G)=11212026.05 | 49.9 | — | — | |
| CAFormer-S18Params (M)=54, MACs (G)=10242026.05 | 48.9 | — | — | |
| ConvFormer-S18Params (M)=54, MACs (G)=9252026.05 | 48.6 | — | — | |
| NaLaFormer-SPARA=25M, F=29G2025.06 | 48.5 | — | — | |
| VWFormer-B2PARA=27M, F=47G2025.06 | 48.1 | — | — | |
| MambaOut-TPARA=54M2025.06 | 47.4 | — | — | |
| VRWKV-SPARA=29M, F=46G2025.06 | 47.2 | — | — | |
| NaLaFormer-TPARA=14M, F=15G2025.06 | 46.9 | — | — | |
| SegFormer-B2PARA=28M, F=62G2025.06 | 46.5 | — | — | |
| EfficientViT-B2PARA=15M, F=9.1G2025.06 | 45.9 | — | — | |
| ViT-UpBackbone=DINOv3-S+, Evaluation Protocol=Linear probing2026.06 | 44.73 | — | 77.06 | |
| SegNeXt-SPARA=15M, F=16G2025.06 | 44.3 | — | — | |
| UpLiFTBackbone=DINOv3-S+, Evaluation Protocol=Linear probing2026.06 | 44.24 | — | 76.71 | |
| NAFBackbone=DINOv3-S+, Evaluation Protocol=Linear probing2026.06 | 44.17 | — | 76.69 | |
| VWFormer-B1PARA=14M, F=13G2025.06 | 44 | — | — | |
| BilinearBackbone=DINOv3-S+, Evaluation Protocol=Linear probing2026.06 | 43.27 | — | 76.17 | |
| PVT-S + RPAttentionFLOPs=169G, Params=24M2026.05 | 42.91 | 55.04 | — | |
| AnyUpBackbone=DINOv3-S+, Evaluation Protocol=Linear probing2026.06 | 42.77 | — | 76.02 | |
| JAFARBackbone=DINOv3-S+, Evaluation Protocol=Linear probing2026.06 | 42.48 | — | 75.81 | |
| PVT-S + AgentFLOPs=169G, Params=24M2026.05 | 42.26 | 54.39 | — | |
| SegFormer-B1PARA=14M, F=16G2025.06 | 42.2 | — | — | |
| PVT-SFLOPs=225G, Params=28M2026.05 | 41.95 | 53.02 | — | |
| PVT-T + RPAttentionFLOPs=128G, Params=15M2026.05 | 39.17 | 50.71 | — | |
| PVT-T + AgentFLOPs=127G, Params=15M2026.05 | 39.01 | 50.49 | — | |
| PVT-TFLOPs=158G, Params=17M2026.05 | 36.57 | 46.72 | — | |
| EgoViTWT-allTraining Data=Full Walking Tours dataset2026.03 | 30.6 | 39.3 | — | |
| EgoViTZurichTraining Data=WT-Zurich (65-minute)2026.03 | 26 | 36.6 | — | |
| AttMaskTraining Data=WT-Zurich (65-minute)2026.03 | 25.1 | 35.4 | — | |
| iBOTTraining Data=WT-Zurich (65-minute)2026.03 | 23.9 | 34.5 | — | |
| MAETraining Data=WT-Zurich (65-minute)2026.03 | 23 | 33.2 | — | |
| LPOSS+Base Framework=LPOSS+, Protocol=Zero-shot2026.06 | 22.7 | — | — | |
| SimCLRTraining Data=WT-Zurich (65-minute)2026.03 | 22.5 | 32.8 | — | |
| DORATraining Data=WT-Zurich (65-minute)2026.03 | 21.6 | 31.1 | — | |
| GPUAmode=zero-shot2026.06 | 21.3 | — | — | |
| SC-CLIP + GPUA (DINOv3)Base Framework=SC-CLIP, Alignment Strategy=GPUA, Visual Foundation Model=DINOv3, Protocol=Zero-shot2026.06 | 21.3 | — | — | |
| DINOTraining Data=WT-Zurich (65-minute)2026.03 | 21.2 | 30.3 | — | |
| Talk2DINOmode=zero-shot2026.06 | 21.1 | — | — | |
| Talk2DINOBase Framework=Talk2DINO, Protocol=Zero-shot2026.06 | 21.1 | — | — | |
| SC-CLIPmode=zero-shot2026.06 | 20.1 | — | — | |
| SC-CLIPBase Framework=SC-CLIP, Protocol=Zero-shot2026.06 | 20.1 | — | — | |
| MaskedPGDbackbone=UPerNet+ConvNeXt-T, training_strategy=PIR-AT, epsilon=4/2552026.05 | 20 | — | 57 | |
| CEPGDbackbone=UPerNet+ConvNeXt-T, training_strategy=PIR-AT, epsilon=4/2552026.05 | 19.8 | — | 57.5 | |
| ProxyCLIPBase Framework=ProxyCLIP, Protocol=Zero-shot2026.06 | 19.7 | — | — | |
| SCLIP + GPUA (DINOv3)Base Framework=SCLIP, Alignment Strategy=GPUA, Visual Foundation Model=DINOv3, Protocol=Zero-shot2026.06 | 19.1 | — | — | |
| CosPGDbackbone=UPerNet+ConvNeXt-T, training_strategy=PIR-AT, epsilon=4/2552026.05 | 19 | — | 55.9 | |
| JSPGDbackbone=UPerNet+ConvNeXt-T, training_strategy=PIR-AT, epsilon=4/2552026.05 | 19 | — | 55.9 | |
| SegPGDbackbone=UPerNet+ConvNeXt-T, training_strategy=PIR-AT, epsilon=4/2552026.05 | 18.9 | — | 55.9 | |
| TsallisPGDbackbone=UPerNet+ConvNeXt-T, training_strategy=PIR-AT, epsilon=4/2552026.05 | 18.9 | — | 55.8 | |
| MoCo-v3Training Data=WT-Zurich (65-minute)2026.03 | 17.9 | 26 | — | |
| MaskedPGDbackbone=Segmenter+ViT-S, training_strategy=PIR-AT, epsilon=4/2552026.05 | 17.8 | — | 56.8 | |
| CEPGDbackbone=Segmenter+ViT-S, training_strategy=PIR-AT, epsilon=4/2552026.05 | 17.3 | — | 57 | |
| CosPGDbackbone=Segmenter+ViT-S, training_strategy=PIR-AT, epsilon=4/2552026.05 | 16.8 | — | 55.7 | |
| JSPGDbackbone=Segmenter+ViT-S, training_strategy=PIR-AT, epsilon=4/2552026.05 | 16.6 | — | 55.6 | |
| SegPGDbackbone=Segmenter+ViT-S, training_strategy=PIR-AT, epsilon=4/2552026.05 | 16.5 | — | 55.5 | |
| TsallisPGDbackbone=Segmenter+ViT-S, training_strategy=PIR-AT, epsilon=4/2552026.05 | 16.5 | — | 55.4 | |
| SCLIPBase Framework=SCLIP, Protocol=Zero-shot2026.06 | 16.1 | — | — | |
| MaskCLIP + GPUA (DINOv3)Base Framework=MaskCLIP, Alignment Strategy=GPUA, Visual Foundation Model=DINOv3, Protocol=Zero-shot2026.06 | 15.9 | — | — | |
| MaskCLIPBase Framework=MaskCLIP, Protocol=Zero-shot2026.06 | 11.9 | — | — | |
| CEPGDbackbone=Segmenter+ViT-S, training_strategy=PIR-AT, epsilon=8/2552026.05 | 9.4 | — | 39.8 | |
| CEPGDbackbone=UPerNet+ConvNeXt-T, training_strategy=PIR-AT, epsilon=8/2552026.05 | 8.9 | — | 35.2 | |
| MaskedPGDbackbone=Segmenter+ViT-S, training_strategy=PIR-AT, epsilon=8/2552026.05 | 8.5 | — | 36 | |
| JSPGDbackbone=Segmenter+ViT-S, training_strategy=PIR-AT, epsilon=8/2552026.05 | 7.7 | — | 34.4 | |
| CosPGDbackbone=Segmenter+ViT-S, training_strategy=PIR-AT, epsilon=8/2552026.05 | 7.6 | — | 34 | |
| TsallisPGDbackbone=Segmenter+ViT-S, training_strategy=PIR-AT, epsilon=8/2552026.05 | 7.6 | — | 34 | |
| MaskedPGDbackbone=UPerNet+ConvNeXt-T, training_strategy=PIR-AT, epsilon=8/2552026.05 | 7.5 | — | 28.5 | |
| SegPGDbackbone=Segmenter+ViT-S, training_strategy=PIR-AT, epsilon=8/2552026.05 | 7.5 | — | 34.3 | |
| JSPGDbackbone=UPerNet+ConvNeXt-T, training_strategy=PIR-AT, epsilon=8/2552026.05 | 7.3 | — | 28.4 | |
| SegPGDbackbone=UPerNet+ConvNeXt-T, training_strategy=PIR-AT, epsilon=8/2552026.05 | 7.2 | — | 28.4 | |
| TsallisPGDbackbone=UPerNet+ConvNeXt-T, training_strategy=PIR-AT, epsilon=8/2552026.05 | 7.1 | — | 27.5 | |
| CosPGDbackbone=UPerNet+ConvNeXt-T, training_strategy=PIR-AT, epsilon=8/2552026.05 | 7 | — | 27.6 | |
| CEPGDbackbone=Segmenter+ViT-S, training_strategy=PIR-AT, epsilon=12/2552026.05 | 3.9 | — | 19.8 | |
| CLIPBase Framework=CLIP, Protocol=Zero-shot2026.06 | 3.1 | — | — | |
| CEPGDbackbone=UPerNet+ConvNeXt-T, training_strategy=PIR-AT, epsilon=12/2552026.05 | 2.5 | — | 13.2 | |
| JSPGDbackbone=Segmenter+ViT-S, training_strategy=PIR-AT, epsilon=12/2552026.05 | 2.1 | — | 10.7 | |
| MaskedPGDbackbone=Segmenter+ViT-S, training_strategy=PIR-AT, epsilon=12/2552026.05 | 2.1 | — | 9.8 | |
| SegPGDbackbone=Segmenter+ViT-S, training_strategy=PIR-AT, epsilon=12/2552026.05 | 2 | — | 10.4 | |
| CosPGDbackbone=Segmenter+ViT-S, training_strategy=PIR-AT, epsilon=12/2552026.05 | 2 | — | 9.6 | |
| TsallisPGDbackbone=Segmenter+ViT-S, training_strategy=PIR-AT, epsilon=12/2552026.05 | 2 | — | 9.1 | |
| SegPGDbackbone=UPerNet+ConvNeXt-T, training_strategy=PIR-AT, epsilon=12/2552026.05 | 1.2 | — | 5.3 | |
| JSPGDbackbone=UPerNet+ConvNeXt-T, training_strategy=PIR-AT, epsilon=12/2552026.05 | 1.2 | — | 4.8 | |
| CosPGDbackbone=UPerNet+ConvNeXt-T, training_strategy=PIR-AT, epsilon=12/2552026.05 | 1 | — | 3.9 | |
| MaskedPGDbackbone=UPerNet+ConvNeXt-T, training_strategy=PIR-AT, epsilon=12/2552026.05 | 0.8 | — | 3.4 | |
| TsallisPGDbackbone=UPerNet+ConvNeXt-T, training_strategy=PIR-AT, epsilon=12/2552026.05 | 0.8 | — | 3.4 |