Monocular Depth Estimation on SUN-RGBD (zero-shot)
96.4Delta Accuracy (< 1.25)UniDepthV2-Large
Evaluation Results
| Method | Links | ||||||||
|---|---|---|---|---|---|---|---|---|---|
| UniDepthV2-Largezero-shot=true, backbone=ViT-Large2025.02 | 96.4 | — | — | 0.068 | — | — | 84.6 | 93.4 | |
| UniDepthV2-Basezero-shot=true, backbone=ViT-Base2025.02 | 94.4 | — | — | 0.084 | — | — | 79.9 | 91.1 | |
| UniDepthzero-shot=true2025.02 | 94.3 | — | — | 0.104 | — | — | 78.6 | 85.8 | |
| UniDepthV2-Smallzero-shot=true, backbone=ViT-Small2025.02 | 90.8 | — | — | 0.105 | — | — | 74.2 | 87.7 | |
| DepthAnythingScaling=Linear Fit, Scale Training Dataset=SUN-RGBD2024.10 | 87.8 | 97.9 | 99.5 | 0.113 | 0.054 | 0.332 | — | — | |
| ZoeDepth-M12Scaling=Image, Scale Training Dataset=NYUv2, Pre-training=12 datasets2024.10 | 86.4 | — | — | 0.119 | — | 0.346 | — | — | |
| ZoeDepth-XScaling=Image, Scale Training Dataset=NYUv2, Pre-training=None2024.10 | 85.7 | — | — | 0.124 | — | 0.363 | — | — | |
| ZoeDepth-M12Scaling=Image, Scale Training Dataset=NYUv2, KITTI, Pre-training=12 datasets2024.10 | 85.6 | — | — | 0.123 | — | 0.356 | — | — | |
| DepthProzero-shot=true2025.02 | 83.1 | — | — | 0.133 | — | — | 71.1 | 89.3 | |
| DepthFormerScale Training Dataset=NYUv22024.10 | 81.5 | 97 | 99.3 | 0.137 | 0.059 | 0.408 | — | — | |
| DPTScaling=Linear Fit, Scale Training Dataset=SUN-RGBD2024.10 | 81.2 | 96.7 | 99.3 | 0.139 | 0.059 | 0.412 | — | — | |
| Metric3Dv2zero-shot=true, requires ground-truth camera for 3D reconstruction=true2025.02 | 81.2 | — | — | 0.133 | — | — | — | — | |
| ZoeDepthzero-shot=true2025.02 | 80.9 | — | — | 0.136 | — | — | — | — | |
| MASt3Rzero-shot=true2025.02 | 80.1 | — | — | 0.144 | — | — | 71.5 | 92 | |
| DPTScaling=RSA (Ours), Scale Training Dataset=NYUv2, KITTI, VOID2024.10 | 78.8 | 95.3 | 98.6 | 0.15 | 0.065 | 0.458 | — | — | |
| DPTScaling=RSA (Ours), Scale Training Dataset=NYUv2, KITTI2024.10 | 78.1 | 95.3 | 98.6 | 0.152 | 0.066 | 0.463 | — | — | |
| DPTScaling=Image, Scale Training Dataset=NYUv2, KITTI2024.10 | 77.8 | 95.3 | 98.4 | 0.153 | 0.068 | 0.478 | — | — | |
| DPTScaling=Global, Scale Training Dataset=NYUv22024.10 | 77.3 | 94.5 | 98.4 | 0.154 | 0.071 | 0.482 | — | — | |
| AdabinsScale Training Dataset=NYUv22024.10 | 77.1 | 94.4 | 98.3 | 0.159 | 0.068 | 0.476 | — | — | |
| DepthAnythingScaling=RSA (Ours), Scale Training Dataset=NYUv2, KITTI, VOID2024.10 | 64.5 | 92.7 | 97.8 | 0.203 | 0.095 | 1.137 | — | — | |
| MiDasScaling=Linear Fit, Scale Training Dataset=SUN-RGBD2024.10 | 63.2 | 91.2 | 97.1 | 0.241 | 0.102 | 1.132 | — | — | |
| MiDasScaling=RSA (Ours), Scale Training Dataset=NYUv2, KITTI, VOID2024.10 | 62.3 | 90.8 | 96.8 | 0.253 | 0.116 | 1.223 | — | — | |
| DepthAnythingScaling=RSA (Ours), Scale Training Dataset=NYUv2, KITTI2024.10 | 62.1 | 91.5 | 97 | 0.238 | 0.099 | 1.024 | — | — | |
| MiDasScaling=RSA (Ours), Scale Training Dataset=NYUv2, KITTI2024.10 | 61.2 | 90.3 | 96.4 | 0.268 | 0.122 | 1.302 | — | — | |
| MiDasScaling=Image, Scale Training Dataset=NYUv2, KITTI2024.10 | 59.4 | 89.5 | 96.2 | 0.275 | 0.125 | 1.374 | — | — | |
| DepthAnythingScaling=Image, Scale Training Dataset=NYUv2, KITTI, VOID2024.10 | 58.8 | 89.2 | 96.3 | 0.279 | 0.126 | 1.392 | — | — | |
| MiDasScaling=Global, Scale Training Dataset=NYUv22024.10 | 57.2 | 88.9 | 95.6 | 0.297 | 0.132 | 1.464 | — | — | |
| DepthAnythingScaling=Global, Scale Training Dataset=NYUv22024.10 | 53.4 | 87.2 | 95.1 | 0.313 | 0.138 | 1.692 | — | — | |
| Metric3Dzero-shot=true, requires ground-truth camera for 3D reconstruction=true, requires ground-truth camera for 2D depth map inference=true2025.02 | 1.9 | — | — | 0.487 | — | — | — | — |