Depth Estimation on SUN RGB-D (test)
0.275Root Mean Square Error (RMS)DMD-MIX
Evaluation Results
| Method | Links | ||||||||||
|---|---|---|---|---|---|---|---|---|---|---|---|
| DMD-MIXtraining_data=NYU, KITTI, Taskonomy and nuScenes, evaluation_mode=zero-shot, depth_constraint=< 8m2023.12 | 0.275 | 93 | — | — | 0.091 | — | — | — | — | — | |
| MGBackbone=Swin-L, Training=Zero-shot (trained on NYU Depth V2)2023.03 | 0.282 | 93.6 | — | — | — | 0.12 | — | 0.09 | 11.985 | — | |
| VA-DepthNetBackbone=Swin-L2023.02 | 0.299 | 92.9 | 98.3 | — | — | 0.127 | — | 0.094 | 12.596 | — | |
| DMD-NKtraining_data=NYU and KITTI, evaluation_mode=zero-shot, depth_constraint=< 8m2023.12 | 0.306 | 91.4 | — | — | 0.109 | — | — | — | — | — | |
| ECoDepthZero-shot transfer=true, Training datasets=NYUv2, Evaluation depth cap=8m2024.03 | 0.319 | 88.5 | — | — | 0.112 | — | — | — | — | 20.5 | |
| AdaBinsBackbone=EffNet-B5+ViT-mini2023.02 | 0.321 | 90.6 | 98.2 | — | — | 0.137 | — | 0.11 | 13.652 | — | |
| AdaBinsBackbone=EffNet-B5+ViT-mini, Training=Zero-shot (trained on NYU Depth V2)2023.03 | 0.321 | 90.6 | — | — | — | 0.137 | — | 0.11 | 13.652 | — | |
| NeWCRFsBackbone=Swin-L2023.02 | 0.322 | 92 | 98 | — | — | 0.138 | — | 0.105 | 13.695 | — | |
| NeWCRFsBackbone=Swin-L, Training=Zero-shot (trained on NYU Depth V2)2023.03 | 0.322 | 92 | — | — | — | 0.138 | — | 0.105 | 13.695 | — | |
| DINOv2Arch=ViT-g/14, Evaluation Protocol=DPT2023.04 | 0.338 | — | — | — | — | — | — | — | — | — | |
| ZoeD-M12-Nevaluation_mode=zero-shot transfer, relative depth pre-training=M12, metric depth fine-tuning=NYU2023.02 | 0.346 | 86.4 | 98.2 | 99.5 | 0.119 | 0.052 | — | — | — | — | |
| ZoeD-M12-NZero-shot transfer=true, Training datasets=12 datasets, Evaluation depth cap=8m2024.03 | 0.346 | 86.4 | — | — | 0.119 | — | — | — | — | 16 | |
| VPDZero-shot transfer=true, Training datasets=NYUv2, Evaluation depth cap=8m2024.03 | 0.355 | 86.1 | — | — | 0.121 | — | — | — | — | 14.7 | |
| ZoeD-M12-NKevaluation_mode=zero-shot transfer, relative depth pre-training=M12, metric depth fine-tuning=NYU+KITTI2023.02 | 0.356 | 85.6 | 97.9 | 99.5 | 0.123 | 0.053 | — | — | — | — | |
| ZoeD-M12-NKevaluation_mode=zero-shot, depth_constraint=< 8m2023.12 | 0.356 | 85.6 | — | — | 0.123 | — | — | — | — | — | |
| ZoeD-NK-Nevaluation_mode=zero-shot transfer, relative depth pre-training=NYU+KITTI, metric depth fine-tuning=NYU2023.02 | 0.36 | 85.7 | 97.8 | 99.4 | 0.125 | 0.054 | — | — | — | — | |
| DINOv2Arch=ViT-L/14, Evaluation Protocol=DPT2023.04 | 0.36 | — | — | — | — | — | — | — | — | — | |
| DINOv2Arch=ViT-g/14, Evaluation Protocol=lin. 42023.04 | 0.362 | — | — | — | — | — | — | — | — | — | |
| ZoeD-X-Nevaluation_mode=zero-shot transfer, relative depth pre-training=X, metric depth fine-tuning=NYU2023.02 | 0.363 | 85.7 | 97.9 | 99.5 | 0.124 | 0.054 | — | — | — | — | |
| DINOv2Arch=ViT-B/14, Evaluation Protocol=DPT2023.04 | 0.377 | — | — | — | — | — | — | — | — | — | |
| DINOv2Arch=ViT-L/14, Evaluation Protocol=lin. 42023.04 | 0.396 | — | — | — | — | — | — | — | — | — | |
| DDPFine-tuning=false, Pre-trained Dataset=NYU-DepthV2, Steps=32023.03 | 0.397 | 82.5 | 97.3 | 99.4 | 0.128 | 0.056 | — | — | — | — | |
| DINOv2Arch=ViT-B/14, Evaluation Protocol=lin. 42023.04 | 0.4 | — | — | — | — | — | — | — | — | — | |
| DINOv2Arch=ViT-g/14, Evaluation Protocol=lin. 12023.04 | 0.402 | — | — | — | — | — | — | — | — | — | |
| DepthFormerFine-tuning=false, Pre-trained Dataset=NYU-DepthV22023.03 | 0.408 | 81.5 | 97 | 99.3 | 0.137 | 0.059 | — | — | — | — | |
| DepthFormertraining_dataset=NYU-Depth-v2, fine_tuning=false2022.03 | 0.408 | 81.5 | 97 | 99.3 | 0.137 | 0.059 | — | — | — | — | |
| OpenCLIPArch=ViT-G/14, Evaluation Protocol=DPT2023.04 | 0.408 | — | — | — | — | — | — | — | — | — | |
| DINOv2Arch=ViT-S/14, Evaluation Protocol=DPT2023.04 | 0.409 | — | — | — | — | — | — | — | — | — | |
| NDDepthTraining Dataset=NYU-Depth-v2, Evaluation Protocol=Zero-shot Generalization2023.09 | 0.411 | 82 | 97 | — | — | 0.06 | — | 0.137 | — | — | |
| Global-Local Path NetworksPre-trained on=NYU Depth V2, Fine-tuning=false2022.01 | 0.418 | 81.4 | 96.4 | 99.1 | — | 0.061 | — | 0.144 | — | — | |
| BinsFormerEncoder=Swin-Large†, Evaluation Protocol=Zero-shot (trained on NYU-Depth-v2)2022.04 | 0.421 | 80.5 | 96.3 | 99 | 0.143 | 0.061 | — | — | — | — | |
| Li et al.Note=State-of-the-art reference2023.04 | 0.421 | — | — | — | — | — | — | — | — | — | |
| NeWCRFevaluation_mode=zero-shot transfer2023.02 | 0.424 | 79.8 | 96.7 | 99.2 | 0.151 | 0.064 | — | — | — | — | |
| NeWCRFsevaluation_mode=zero-shot, depth_constraint=< 8m2023.12 | 0.424 | 79.8 | — | — | 0.151 | — | — | — | — | — | |
| NeWCRFsZero-shot transfer=true, Training datasets=NYUv2, Evaluation depth cap=8m2024.03 | 0.424 | 79.8 | — | — | 0.151 | — | — | — | — | 0 | |
| iBOTArch=ViT-L/16, Evaluation Protocol=DPT2023.04 | 0.426 | — | — | — | — | — | — | — | — | — | |
| DINOv2Arch=ViT-L/14, Evaluation Protocol=lin. 12023.04 | 0.429 | — | — | — | — | — | — | — | — | — | |
| P3DepthTraining Dataset=NYU Depth-v2, Zero-shot=true2022.04 | 0.431 | 79.7 | — | — | 0.307 | — | — | — | — | — | |
| DINOv2Arch=ViT-S/14, Evaluation Protocol=lin. 42023.04 | 0.431 | — | — | — | — | — | — | — | — | — | |
| iBOTArch=ViT-L/16, Evaluation Protocol=lin. 42023.04 | 0.435 | — | — | — | — | — | — | — | — | — | |
| PixelFormerVenue=Current Paper, Training Dataset=NYUv2, Fine-tuning=false, Max Depth=8m2022.10 | 0.441 | 80.2 | 96.2 | 99 | — | 0.062 | 0.0915 | 0.144 | — | — | |
| iBOTArch=ViT-L/16, Evaluation Protocol=lin. 12023.04 | 0.447 | — | — | — | — | — | — | — | — | — | |
| DINOv2Arch=ViT-B/14, Evaluation Protocol=lin. 12023.04 | 0.448 | — | — | — | — | — | — | — | — | — | |
| VNLTraining Dataset=NYU Depth-v2, Zero-shot=true2022.04 | 0.449 | 79.3 | — | — | 0.317 | — | — | — | — | — | |
| BTSTraining Dataset=NYU Depth-v2, Zero-shot=true2022.04 | 0.461 | 79.4 | — | — | 0.317 | — | — | — | — | — | |
| LocalBinsTraining Dataset=NYU-Depth V2, Fine-tuning=None (Zero-shot)2022.03 | 0.47 | 77.7 | 94.9 | 98.5 | 0.156 | 0.067 | — | — | — | — | |
| LocalBinsevaluation_mode=zero-shot transfer2023.02 | 0.47 | 77.7 | 94.9 | 98.5 | 0.156 | 0.067 | — | — | — | — | |
| LocalBinsevaluation_mode=zero-shot, depth_constraint=< 8m2023.12 | 0.47 | 77.7 | — | — | 0.156 | — | — | — | — | — | |
| LocalBinsZero-shot transfer=true, Training datasets=NYUv2, Evaluation depth cap=8m2024.03 | 0.47 | 77.7 | — | — | 0.156 | — | — | — | — | -5.6 | |
| AdaBinsTraining Dataset=NYU-Depth V2, Fine-tuning=None (Zero-shot)2022.03 | 0.476 | 77.1 | 94.4 | 98.3 | 0.159 | 0.068 | — | — | — | — | |
| AdaBinsEncoder=E-B5+Mini-ViT, Evaluation Protocol=Zero-shot (trained on NYU-Depth-v2)2022.04 | 0.476 | 77.1 | 94.4 | 98.3 | 0.159 | 0.068 | — | — | — | — | |
| AdabinsVenue=CVPR'21, Training Dataset=NYUv2, Fine-tuning=false, Max Depth=8m2022.10 | 0.476 | 77.1 | 94.4 | 98.3 | — | 0.068 | — | 0.159 | — | — | |
| AdabinsPre-trained on=NYU Depth V2, Fine-tuning=false2022.01 | 0.476 | 77.1 | 94.4 | 98.3 | — | 0.068 | — | 0.159 | — | — | |
| AdaBinsevaluation_mode=zero-shot transfer2023.02 | 0.476 | 77.1 | 94.4 | 98.3 | 0.159 | 0.068 | — | — | — | — | |
| AdaBinsFine-tuning=false, Pre-trained Dataset=NYU-DepthV22023.03 | 0.476 | 77.1 | 94.4 | 98.3 | 0.159 | 0.068 | — | — | — | — | |
| AdabinsTraining Dataset=NYU-Depth-v2, Evaluation Protocol=Zero-shot Generalization2023.09 | 0.476 | 77.1 | 94.4 | — | — | 0.068 | — | 0.159 | — | — | |
| Adabinstraining_dataset=NYU-Depth-v2, fine_tuning=false2022.03 | 0.476 | 77.1 | 94.4 | 98.3 | 0.159 | 0.068 | — | — | — | — | |
| AdaBinsevaluation_mode=zero-shot, depth_constraint=< 8m2023.12 | 0.476 | 77.1 | — | — | 0.159 | — | — | — | — | — | |
| OpenCLIPArch=ViT-G/14, Evaluation Protocol=lin. 42023.04 | 0.476 | — | — | — | — | — | — | — | — | — | |
| AdaBinsZero-shot transfer=true, Training datasets=NYUv2, Evaluation depth cap=8m2024.03 | 0.476 | 77.1 | — | — | 0.159 | — | — | — | — | -7 | |
| DINOv2Arch=ViT-S/14, Evaluation Protocol=lin. 12023.04 | 0.477 | — | — | — | — | — | — | — | — | — | |
| BinsFormerEncoder=Swin-Tiny, Evaluation Protocol=Zero-shot (trained on NYU-Depth-v2)2022.04 | 0.478 | 76 | 94.5 | 98.5 | 0.162 | 0.069 | — | — | — | — | |
| ChenTraining Dataset=NYU-Depth V2, Fine-tuning=None (Zero-shot)2022.03 | 0.494 | 75.7 | 94.3 | 98.4 | 0.166 | 0.071 | — | — | — | — | |
| Chen et al.Encoder=SENet [19], Evaluation Protocol=Zero-shot (trained on NYU-Depth-v2)2022.04 | 0.494 | 75.7 | 94.3 | 98.4 | 0.166 | 0.071 | — | — | — | — | |
| Chen et al.Venue=IJCAI'19, Training Dataset=NYUv2, Fine-tuning=false, Max Depth=8m2022.10 | 0.494 | 75.7 | 94.3 | 98.4 | — | 0.071 | — | 0.166 | — | — | |
| Chen et al.Fine-tuning=false, Pre-trained Dataset=NYU-DepthV22023.03 | 0.494 | 75.7 | 94.3 | 98.4 | 0.166 | 0.071 | — | — | — | — | |
| ChenTraining Dataset=NYU-Depth-v2, Evaluation Protocol=Zero-shot Generalization2023.09 | 0.494 | 75.7 | 94.3 | — | — | 0.071 | — | 0.166 | — | — | |
| Chen et al.training_dataset=NYU-Depth-v2, fine_tuning=false2022.03 | 0.494 | 75.7 | 94.3 | 98.4 | 0.166 | 0.071 | — | — | — | — | |
| BinsFormerEncoder=ResNet-18, Evaluation Protocol=Zero-shot (trained on NYU-Depth-v2)2022.04 | 0.504 | 73.8 | 93.5 | 98.2 | 0.175 | 0.074 | — | — | — | — | |
| MAEArch=ViT-H/14, Evaluation Protocol=DPT2023.04 | 0.506 | — | — | — | — | — | — | — | — | — | |
| BTSTraining Dataset=NYU-Depth V2, Fine-tuning=None (Zero-shot)2022.03 | 0.515 | 74 | 93.3 | 98 | 0.172 | 0.075 | — | — | — | — | |
| BTSEncoder=DenseNet-161, Evaluation Protocol=Zero-shot (trained on NYU-Depth-v2)2022.04 | 0.515 | 74 | 93.3 | 98 | 0.172 | 0.075 | — | — | — | — | |
| BTSVenue=Arxiv'19, Training Dataset=NYUv2, Fine-tuning=false, Max Depth=8m2022.10 | 0.515 | 74 | 93.3 | 98 | — | 0.075 | — | 0.172 | — | — | |
| BTSPre-trained on=NYU Depth V2, Fine-tuning=false2022.01 | 0.515 | 74 | 93.3 | 98 | — | 0.075 | — | 0.172 | — | — | |
| BTSevaluation_mode=zero-shot transfer2023.02 | 0.515 | 74 | 93.3 | 98 | 0.172 | 0.075 | — | — | — | — | |
| BTSFine-tuning=false, Pre-trained Dataset=NYU-DepthV22023.03 | 0.515 | 74 | 93.3 | 98 | 0.172 | 0.075 | — | — | — | — | |
| BTSTraining Dataset=NYU-Depth-v2, Evaluation Protocol=Zero-shot Generalization2023.09 | 0.515 | 74 | 93.3 | — | — | 0.075 | — | 0.172 | — | — | |
| BTStraining_dataset=NYU-Depth-v2, fine_tuning=false2022.03 | 0.515 | 74 | 93.3 | 98 | 0.172 | 0.075 | — | — | — | — | |
| BTSevaluation_mode=zero-shot, depth_constraint=< 8m2023.12 | 0.515 | 74 | — | — | 0.172 | — | — | — | — | — | |
| BTSZero-shot transfer=true, Training datasets=NYUv2, Evaluation depth cap=8m2024.03 | 0.515 | 74 | — | — | 0.172 | — | — | — | — | -14.2 | |
| DINOArch=ViT-B/8, Evaluation Protocol=DPT2023.04 | 0.52 | — | — | — | — | — | — | — | — | — | |
| MAEArch=ViT-H/14, Evaluation Protocol=lin. 42023.04 | 0.523 | — | — | — | — | — | — | — | — | — | |
| OpenCLIPArch=ViT-G/14, Evaluation Protocol=lin. 12023.04 | 0.537 | — | — | — | — | — | — | — | — | — | |
| YinTraining Dataset=NYU-Depth V2, Fine-tuning=None (Zero-shot)2022.03 | 0.541 | 69.6 | 91.2 | 97.3 | 0.183 | 0.082 | — | — | — | — | |
| Yin et al.Encoder=ResNeXt-101, Evaluation Protocol=Zero-shot (trained on NYU-Depth-v2)2022.04 | 0.541 | 69.6 | 91.2 | 97.3 | 0.183 | 0.082 | — | — | — | — | |
| Yin et al.Venue=ICCV'19, Training Dataset=NYUv2, Fine-tuning=false, Max Depth=8m2022.10 | 0.541 | 69.6 | 91.2 | 97.3 | — | 0.082 | — | 0.183 | — | — | |
| YinPre-trained on=NYU Depth V2, Fine-tuning=false2022.01 | 0.541 | 69.6 | 91.2 | 97.3 | — | 0.082 | — | 0.183 | — | — | |
| Yin et al.Fine-tuning=false, Pre-trained Dataset=NYU-DepthV22023.03 | 0.541 | 69.6 | 91.2 | 97.3 | 0.183 | 0.082 | — | — | — | — | |
| VNLTraining Dataset=NYU-Depth-v2, Evaluation Protocol=Zero-shot Generalization2023.09 | 0.541 | 69.6 | 91.2 | — | — | 0.082 | — | 0.183 | — | — | |
| Yin et al.training_dataset=NYU-Depth-v2, fine_tuning=false2022.03 | 0.541 | 69.6 | 91.2 | 97.3 | 0.183 | 0.082 | — | — | — | — | |
| DINOArch=ViT-B/8, Evaluation Protocol=lin. 42023.04 | 0.541 | — | — | — | — | — | — | — | — | — | |
| MAEArch=ViT-H/14, Evaluation Protocol=lin. 12023.04 | 0.545 | — | — | — | — | — | — | — | — | — | |
| DINOArch=ViT-B/8, Evaluation Protocol=lin. 12023.04 | 0.553 | — | — | — | — | — | — | — | — | — |