Monocular Depth Estimation on SUN-RGBD (test)
0.098AbsRelGRIN
Evaluation Results
| Method | Links | ||||||
|---|---|---|---|---|---|---|---|
| GRINzero_shot=true, require_camera_intrinsics=true2024.09 | 0.098 | 92.7 | — | — | — | 0.301 | |
| DINOv3-L+LDAtraining_dataset=NYU Depth v2, zero-shot=true, fine-tuning=none2026.04 | 0.099 | 90.7 | — | — | 0.044 | 0.3 | |
| DINOv3-Ltraining_dataset=NYU Depth v2, zero-shot=true, fine-tuning=none2026.04 | 0.101 | 89.5 | — | — | 0.046 | 0.312 | |
| Metric3Dzero_shot=true, require_camera_intrinsics=true2024.09 | 0.104 | 91.9 | — | — | — | 0.319 | |
| UniDepthzero_shot=true, model_variant=UniDepth-C, require_camera_intrinsics=true2024.09 | 0.106 | 91.8 | — | — | — | 0.316 | |
| DMDzero_shot=true, require_camera_intrinsics=true2024.09 | 0.109 | 91.4 | — | — | — | 0.306 | |
| EcoDepthtraining_dataset=NYU Depth v2, zero-shot=true, fine-tuning=none2026.04 | 0.112 | 88.5 | — | — | — | 0.319 | |
| DAR-Ltraining_dataset=NYU Depth v2, zero-shot=true, fine-tuning=none2026.04 | 0.112 | 88.5 | — | — | 0.04 | 0.319 | |
| Linear Fit (oracle)Backbone=DepthAnything-S, Train=SUN-RGBD (oracle)2026.01 | 0.113 | — | — | 0.995 | — | 0.332 | |
| DA v1training_dataset=NYU Depth v2, zero-shot=true, fine-tuning=none2026.04 | 0.119 | 86.4 | — | — | 0.043 | 0.346 | |
| ZeroDepthzero_shot=true, require_camera_intrinsics=true2024.09 | 0.121 | 86.4 | — | — | — | 0.347 | |
| VPDtraining_dataset=NYU Depth v2, zero-shot=true, fine-tuning=none2026.04 | 0.121 | 86.1 | — | — | 0.045 | 0.355 | |
| WorDepthZero-shot=true, Backbone=Swin-L2024.04 | 0.123 | 83.3 | 97.6 | 99.4 | 0.054 | 0.376 | |
| ZoeDepthzero_shot=true, require_camera_intrinsics=false2024.09 | 0.123 | 85.6 | — | — | — | 0.356 | |
| ZoeDepth-XScaling=Image, Train=NYUv22026.01 | 0.124 | — | — | — | — | 0.363 | |
| DepthFormerZero-shot=true, Backbone=Swin-L2024.04 | 0.137 | 81.5 | 97 | 99.3 | 0.059 | 0.408 | |
| Linear Fit (oracle)Backbone=DPT-Hybrid, Train=SUN-RGBD (oracle)2026.01 | 0.139 | — | — | 0.993 | — | 0.412 | |
| BaselineZero-shot=true, Backbone=Swin-L2024.04 | 0.141 | 80.3 | 96.5 | 99 | 0.062 | 0.427 | |
| BTStraining_dataset=NYU Depth v2, zero-shot=true, fine-tuning=none2026.04 | 0.143 | 80.5 | — | — | 0.061 | 0.421 | |
| Language-guided Depth Calibration FrameworkBackbone=DPT-Hybrid, Train=NYUv2, KITTI2026.01 | 0.147 | — | — | 0.986 | — | 0.437 | |
| NeWCRFstraining_dataset=NYU Depth v2, zero-shot=true, fine-tuning=none2026.04 | 0.15 | 79.9 | — | — | — | 0.429 | |
| NeWCRFszero_shot=true, require_camera_intrinsics=true2024.09 | 0.151 | 79.8 | — | — | — | 0.424 | |
| RSABackbone=DPT-Hybrid, Train=NYUv2, KITTI2026.01 | 0.152 | — | — | 0.986 | — | 0.463 | |
| Image-based ScalingBackbone=DPT-Hybrid, Train=NYUv2, KITTI2026.01 | 0.153 | — | — | 0.984 | — | 0.478 | |
| Global ScalingBackbone=DPT-Hybrid, Train=NYUv2, KITTI2026.01 | 0.154 | — | — | 0.984 | — | 0.482 | |
| AdabinsZero-shot=true, Backbone=EffNet-B5+ViT-mini2024.04 | 0.159 | 77.1 | 94.4 | 98.3 | 0.068 | 0.476 | |
| AdaBinszero_shot=true, require_camera_intrinsics=true2024.09 | 0.159 | 77.1 | — | — | — | 0.476 | |
| AdaBinstraining_dataset=NYU Depth v2, zero-shot=true, fine-tuning=none2026.04 | 0.159 | 76.8 | — | — | — | 0.476 | |
| Language-guided Depth Calibration FrameworkBackbone=DepthAnything-S, Train=NYUv2, KITTI2026.01 | 0.213 | — | — | 0.975 | — | 0.967 | |
| RSABackbone=DepthAnything-S, Train=NYUv2, KITTI2026.01 | 0.238 | — | — | 0.97 | — | 1.024 | |
| Image-based ScalingBackbone=DepthAnything-S, Train=NYUv2, KITTI2026.01 | 0.279 | — | — | 0.963 | — | 1.392 |