Depth Estimation on NYU v2 (test)
98.9Threshold Accuracy (delta < 1.25)VGGT
Evaluation Results
| Method | Links | ||||||||||||||||||||||||||||||||||||
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| VGGTscale_mode=relative (aligned to ground-truth)2025.09 | 98.9 | — | — | — | — | — | — | — | — | — | — | 0.011 | 0.103 | 0.022 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Vid-LLM2025.09 | 98.7 | — | — | — | — | — | — | — | — | — | — | 0.01 | 0.109 | 0.025 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Depth AnythingTraining=Fine-tuning, Backbone=ViT-L, Framework=ZoeDepth2024.01 | 98.4 | — | — | — | — | 99.8 | 100 | — | — | — | — | 0.024 | 0.206 | 0.056 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Depth Anything V2Encoder=ViT-L2024.06 | 98.4 | — | — | — | — | 99.8 | 100 | — | — | — | — | 0.024 | 0.206 | 0.056 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| DepthAnything2025.09 | 98.4 | — | — | — | — | — | — | — | — | — | — | 0.024 | 0.206 | 0.056 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Depth Anything V2Encoder=ViT-B2024.06 | 97.7 | — | — | — | — | 99.7 | 100 | — | — | — | — | 0.027 | 0.228 | 0.063 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| TADP-40Schedule=default schedule, Minimum caption length=402023.09 | 97.6 | — | 0.062 | — | — | 99.7 | 99.9 | — | — | — | — | 0.027 | 0.225 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| VPD(LS)Schedule=default schedule, Latent Scaling=true2023.09 | 97.1 | — | 0.064 | — | — | 99.6 | 99.9 | — | — | — | — | 0.028 | 0.235 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| CSTM_labelBackbone=ConvNeXt-large, Zero-shot transfer=true, Manually aligned scale and shift=true2023.07 | 96.6 | — | — | — | — | — | — | — | — | — | — | — | — | 0.05 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| VPD(R)Schedule=default schedule, Variant=R2023.09 | 96.5 | — | 0.068 | — | — | 99.5 | 99.9 | — | — | — | — | 0.029 | 0.248 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| VPDSchedule=default schedule2023.09 | 96.4 | — | 0.069 | — | — | 99.5 | 99.9 | — | — | — | — | 0.03 | 0.254 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| VPDTraining=Fine-tuning2024.01 | 96.4 | — | — | — | — | 99.5 | 99.9 | — | — | — | — | 0.03 | 0.254 | 0.069 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| VPDEncoder=ViT-L scale2024.06 | 96.4 | — | — | — | — | 99.5 | 99.9 | — | — | — | — | 0.03 | 0.254 | 0.069 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| VPD2025.09 | 96.4 | — | — | — | — | — | — | — | — | — | — | 0.03 | 0.254 | 0.069 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| CSTM_imageBackbone=ConvNeXt-large, #Params=198M, Zero-shot transfer=true, Manually aligned scale and shift=true2023.07 | 96.3 | — | — | — | — | — | — | — | — | — | — | — | — | 0.058 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Depth Anything V2Encoder=ViT-S2024.06 | 96.1 | — | — | — | — | 99.6 | 99.9 | — | — | — | — | 0.032 | 0.261 | 0.073 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Focal stackInput Source=Focal Stack, AIF Source=syn. I_AIF2022.03 | 95.9 | — | — | — | — | 99 | 99.7 | — | — | — | — | — | 0.31 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| ZoeD-M12-Npre-training=Relative Depth2023.02 | 95.5 | — | 0.075 | — | — | 99.5 | 99.9 | — | — | — | — | 0.032 | 0.27 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| ZoeDepthSchedule=default schedule2023.09 | 95.5 | — | 0.075 | — | — | 99.5 | 99.9 | — | — | — | — | 0.032 | 0.27 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Focal stackInput Source=Focal Stack, AIF Source=g.t. I_AIF2022.03 | 95.5 | — | — | — | — | 98.5 | 99.7 | — | — | — | — | — | 0.244 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| AiTSchedule=default schedule2023.09 | 95.4 | — | 0.076 | — | — | 99.4 | 99.9 | — | — | — | — | 0.033 | 0.275 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| AiTTraining=Fine-tuning2024.01 | 95.4 | — | — | — | — | 99.4 | 99.9 | — | — | — | — | 0.033 | 0.275 | 0.076 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| AiTEncoder=ViT-L scale2024.06 | 95.4 | — | — | — | — | 99.4 | 99.9 | — | — | — | — | 0.033 | 0.275 | 0.076 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| AiT2025.09 | 95.4 | — | — | — | — | — | — | — | — | — | — | 0.033 | 0.275 | 0.076 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| ZoeD-M12-NKpre-training=Relative Depth, multi-dataset-training=true2023.02 | 95.3 | — | 0.077 | — | — | 99.5 | 99.9 | — | — | — | — | 0.033 | 0.277 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| ZoeDepth2025.09 | 95.3 | — | — | — | — | — | — | — | — | — | — | 0.032 | 0.27 | 0.075 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| ZoeDepthTraining=Fine-tuning, reproduced=true2024.01 | 95.1 | — | — | — | — | 99.4 | 99.9 | — | — | — | — | 0.033 | 0.282 | 0.077 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| ZoeDepthEncoder=ViT-L scale2024.06 | 95.1 | — | — | — | — | 99.4 | 99.9 | — | — | — | — | 0.033 | 0.282 | 0.077 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| SwinV2-LSchedule=default schedule2023.09 | 94.9 | — | 0.083 | — | — | 99.4 | 99.9 | — | — | — | — | 0.035 | 0.287 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| SwinV2-LTraining=Fine-tuning2024.01 | 94.9 | — | — | — | — | 99.4 | 99.9 | — | — | — | — | 0.035 | 0.287 | 0.083 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| SwinV2Encoder=ViT-L scale2024.06 | 94.9 | — | — | — | — | 99.4 | 99.9 | — | — | — | — | 0.035 | 0.287 | 0.083 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| SwinV2-L2025.09 | 94.9 | — | — | — | — | — | — | — | — | — | — | 0.035 | 0.287 | 0.083 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| HDNBackbone=ViT-Large, #Params=306M, Zero-shot transfer=true, Manually aligned scale and shift=true2023.07 | 94.8 | — | — | — | — | — | — | — | — | — | — | — | — | 0.069 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| ZoeD-X-Npre-training=ImageNet2023.02 | 94.6 | — | 0.082 | — | — | 99.4 | 99.9 | — | — | — | — | 0.035 | 0.294 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| OmnidataBackbone=ViT-base, Zero-shot transfer=true, Manually aligned scale and shift=true2023.07 | 94.5 | — | — | — | — | — | — | — | — | — | — | — | — | 0.074 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| 4M-LPre-training data=CC12M, Data aug.=false, Extra labels=true2023.12 | 94.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Niklaus et al.Supervision=supervised2021.08 | 94 | — | — | — | — | 99 | 100 | — | — | — | — | 0.03 | 0.3 | 0.08 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| MAE LPre-training data=IN-1K, Data aug.=true, Extra labels=false2023.12 | 93.6 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| IEBinsEncoder=ViT-L scale2024.06 | 93.6 | — | — | — | — | 99.2 | 99.8 | — | — | — | — | 0.038 | 0.314 | 0.087 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| TADP-0Schedule=fast schedule, 1 epoch, Minimum caption length=02023.09 | 93.5 | — | 0.082 | — | — | 99.3 | 99.9 | — | — | — | — | 0.038 | 0.328 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| NeW-CRFs + La + Ltloss_terms=La + Lt2023.01 | 93.2 | — | 0.089 | — | — | — | — | — | 0.321 | — | — | 0.039 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| VPD(LS)Schedule=fast schedule, 1 epoch, Latent Scaling=true2023.09 | 92.6 | — | 0.097 | — | — | 99.2 | 99.8 | — | — | — | — | 0.041 | 0.332 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| NeWCRFs2023.02 | 92.2 | — | 0.095 | — | — | 99.2 | 99.8 | — | — | — | — | 0.041 | 0.334 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| NeW-CRFs2023.01 | 92.2 | — | 0.095 | — | — | — | — | — | 0.334 | — | — | 0.041 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| 4M-BPre-training data=CC12M, Data aug.=false, Extra labels=true2023.12 | 92 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Jiao et al.Joint Task Learning=true2019.07 | 91.7 | — | 0.098 | — | — | 98.3 | 99.6 | — | 0.329 | — | — | 0.04 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| LeresBackbone=ResNeXt101, Zero-shot transfer=true, Manually aligned scale and shift=true2023.07 | 91.6 | — | — | — | — | — | — | — | — | — | — | — | — | 0.09 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Global-Local Path NetworksCorruption Type=Clean2022.01 | 91.5 | — | — | — | — | 98.8 | 99.7 | 0.049 | — | 0.124 | — | — | 0.344 | 0.098 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Jun et al.2023.02 | 91.3 | — | 0.098 | — | — | 98.7 | 99.8 | — | — | — | — | 0.042 | 0.355 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| VPD(R)Schedule=fast schedule, 1 epoch, Variant=R2023.09 | 91 | — | 0.1 | — | — | 98.7 | 99.7 | — | — | — | — | 0.042 | 0.34 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| VPDSchedule=fast schedule, 1 epoch2023.09 | 90.9 | — | 0.098 | — | — | 98.9 | 99.8 | — | — | — | — | 0.043 | 0.349 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| CrossFlowZero-shot=true, # Training samples=74K2024.12 | 90.8 | — | — | — | — | — | — | — | — | — | — | — | — | 0.103 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| LocalBinsEncoder=EfficientNet-B5, Number of Parameters=742022.03 | 90.7 | — | 0.099 | — | — | 98.7 | 99.8 | — | 0.357 | — | — | 0.042 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| LocalBins2023.02 | 90.7 | — | 0.099 | — | — | 98.7 | 99.8 | — | — | — | — | 0.042 | 0.357 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| DPTSupervision=Supervised, Train on NYUv2=true2021.12 | 90.4 | — | — | — | — | 98.8 | 99.8 | — | — | — | — | — | 0.357 | 0.11 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| DPTTraining=Fine-tuning2024.01 | 90.4 | — | — | — | — | 98.8 | 99.8 | — | — | — | — | 0.045 | 0.357 | 0.11 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| DPTEncoder=ViT-L scale2024.06 | 90.4 | — | — | — | — | 98.8 | 99.8 | — | — | — | — | 0.045 | 0.357 | 0.11 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| MarigoldZero-shot=true, # Training samples=74K2024.12 | 90.4 | — | — | — | — | — | — | — | — | — | — | — | — | 0.105 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| DPT2025.09 | 90.4 | — | — | — | — | — | — | — | — | — | — | 0.045 | 0.357 | 0.11 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| AdaBinsEncoder=EfficientNet-B5, Number of Parameters=782022.03 | 90.3 | — | 0.103 | — | — | 98.4 | 99.7 | — | 0.364 | — | — | 0.044 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| AdaBins2020.11 | 90.3 | — | 0.103 | — | — | 98.4 | 99.7 | — | — | — | — | 0.044 | 0.364 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| AdaBinsSupervision=Supervised, Train on NYUv2=true2021.12 | 90.3 | — | — | — | — | 98.4 | 99.7 | — | — | — | — | — | 0.364 | 0.103 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| AdabinsCorruption Type=Clean, Weights=Pre-trained2022.01 | 90.3 | — | — | — | — | 98.4 | 99.7 | 0.057 | — | 0.13 | — | — | 0.364 | 0.103 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| AdaBins2023.02 | 90.3 | — | 0.103 | — | — | 98.4 | 99.7 | — | — | — | — | 0.044 | 0.364 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Adabins2023.01 | 90.3 | — | 0.103 | — | — | — | — | — | 0.364 | — | — | 0.044 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| DPT-largeBackbone=ViT-Large, Zero-shot transfer=true, Manually aligned scale and shift=true2023.07 | 90.3 | — | — | — | — | — | — | — | — | — | — | — | — | 0.098 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| AdaBinsTraining=Fine-tuning2024.01 | 90.3 | — | — | — | — | 98.4 | 99.7 | — | — | — | — | 0.044 | 0.364 | 0.103 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| AdaBinsEncoder=ViT-L scale2024.06 | 90.3 | — | — | — | — | 98.4 | 99.7 | — | — | — | — | 0.044 | 0.364 | 0.103 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| AdaBinsSupervision=supervised2021.08 | 90.3 | — | — | — | — | 98.4 | 99.7 | — | — | — | — | 0.044 | 0.364 | 0.103 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| DPTZero-shot=true, # Training samples=1.2M + 188K2024.12 | 90.1 | — | — | — | — | — | — | — | — | — | — | — | — | 0.1 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| TransDepthAGD=true, ViT=true, Full=true2021.03 | 90 | — | 0.106 | — | — | 98.3 | 99.6 | — | — | — | — | 0.045 | 0.365 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| P3DepthTraining=Fine-tuning2024.01 | 89.8 | — | — | — | — | 98.1 | 99.6 | — | — | — | — | 0.043 | 0.356 | 0.104 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| P3DepthEncoder=ViT-L scale2024.06 | 89.8 | — | — | — | — | 98.1 | 99.6 | — | — | — | — | 0.043 | 0.356 | 0.104 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| P3Depth2025.09 | 89.8 | — | — | — | — | — | — | — | — | — | — | 0.043 | 0.356 | 0.104 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| DeiT III LPre-training data=IN-21K, Data aug.=true, Extra labels=false2023.12 | 89.6 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| MAE BPre-training data=IN-1K, Data aug.=true, Extra labels=false2023.12 | 89.1 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| MultiMAE BPre-training data=IN-1K, Data aug.=true, Extra labels=true2023.12 | 89 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| SharpNet2020.10 | 88.8 | — | — | — | — | 97.9 | 99.5 | — | — | — | — | 0.047 | 0.495 | 0.139 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| TransDepth w/ ViTAGD=false, ViT=true2021.03 | 88.7 | — | 0.109 | — | — | 98.1 | 99.6 | — | — | — | — | 0.047 | 0.388 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| BTS2020.10 | 88.5 | — | — | — | — | 97.8 | 99.4 | — | — | — | — | 0.047 | 0.392 | 0.11 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| DSN†setup=most accurate overall results2020.10 | 88.5 | — | — | — | — | 97.9 | 99.4 | — | — | — | — | 0.043 | 0.392 | 0.101 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| BTSBackbone=DenseNet2019.07 | 88.5 | — | — | — | — | 97.8 | 99.4 | — | — | — | — | 0.047 | 0.392 | 0.11 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| BTSEncoder=DenseNet-161, Number of Parameters=472022.03 | 88.5 | — | 0.11 | — | — | 97.8 | 99.4 | — | 0.392 | — | — | 0.047 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| BTS2020.11 | 88.5 | — | 0.11 | — | — | 97.8 | 99.4 | — | — | — | — | 0.047 | 0.392 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| BTSCorruption Type=Clean, Weights=Pre-trained2022.01 | 88.5 | — | — | — | — | 97.8 | 99.4 | 0.066 | — | 0.142 | — | — | 0.392 | 0.11 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| BTS2023.02 | 88.5 | — | 0.11 | — | — | 97.8 | 99.4 | — | — | — | — | 0.047 | 0.392 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| BTS2023.01 | 88.5 | — | 0.11 | — | — | — | — | — | 0.392 | — | — | 0.047 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| MiDaSBackbone=ResNeXt101, #Params=88M, Zero-shot transfer=true, Manually aligned scale and shift=true2023.07 | 88.5 | — | — | — | — | — | — | — | — | — | — | — | — | 0.111 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Huynh et al.2021.03 | 88.2 | — | 0.108 | — | — | 98 | 99.6 | — | — | — | — | — | 0.412 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| DAV2020.11 | 88.2 | — | 0.108 | — | — | 98 | 99.6 | — | — | — | — | — | 0.412 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| TransDepth w/ AGDAGD=true, ViT=false2021.03 | 88.1 | — | 0.111 | — | — | 97.9 | 99.6 | — | — | — | — | 0.048 | 0.393 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| BTSBackbone=ResNeXt2019.07 | 88 | — | — | — | — | 97.7 | 99.4 | — | — | — | — | 0.048 | 0.41 | 0.111 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Ours: Baseline + RPD + ADFFJoint Task Learning=false2019.07 | 87.8 | — | 0.111 | — | — | 97.7 | 99.4 | — | 0.514 | — | — | 0.048 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Chen et al.Encoder=SENet, Number of Parameters=2102022.03 | 87.8 | — | 0.111 | — | — | 97.7 | 99.4 | — | 0.514 | — | — | 0.048 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Chen et al.2020.11 | 87.8 | — | 0.111 | — | — | 97.7 | 99.4 | — | — | — | — | 0.048 | 0.514 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Chen et al.2023.02 | 87.8 | — | 0.111 | — | — | 97.7 | 99.4 | — | — | — | — | 0.048 | 0.514 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Virtual Normal Loss (VNL)Backbone=ResNeXt-1012019.07 | 87.5 | — | 0.108 | — | — | 97.6 | 99.4 | — | 0.416 | — | — | 0.048 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| VNL2020.10 | 87.5 | — | — | — | — | 97.6 | 99.4 | — | — | — | — | 0.048 | 0.416 | 0.108 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| VNLSupervision=Supervised2021.07 | 87.5 | — | — | — | — | 97.6 | 99.4 | — | — | — | — | — | 0.416 | 0.108 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Yin et al.2021.03 | 87.5 | — | 0.108 | — | — | 97.6 | 99.4 | — | — | — | — | 0.048 | 0.416 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — |