Monocular Depth Estimation on NYU v2 (test)
0.036Abs RelVGGT(Depth+Cam)
Evaluation Results
| Method | Links | |||||||||||||
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| VGGT(Depth+Cam)Supervised=true, Zero-shot=true2026.04 | 0.036 | — | — | — | — | 98 | — | — | — | — | — | — | — | |
| DepthAnythingSupervised=true, Zero-shot=true2026.04 | 0.043 | — | — | — | — | 98.1 | — | — | — | — | — | — | — | |
| VDA-LEncoder=ViT-L2026.03 | 0.046 | — | — | — | — | 97.8 | — | — | — | — | — | — | — | |
| MiDASv3.1Supervised=true, Zero-shot=true2026.04 | 0.048 | — | — | — | — | 98 | — | — | — | — | — | — | — | |
| GRINzero-shot=true, test-time scale alignment=true, intrinsics required=false2024.09 | 0.049 | — | — | — | — | — | — | — | — | — | — | — | — | |
| Fractal Visual Autoregressive Diffusion Model (Ours)Encoder=Autoregressive2026.03 | 0.049 | 0.011 | 0.197 | — | 0.023 | 98.4 | 99.8 | 99.9 | — | — | — | — | — | |
| LotusEncoder=Diffusion2026.03 | 0.051 | — | — | — | — | 97.2 | 99.2 | — | — | — | — | — | — | |
| Marigoldzero-shot=true, test-time scale alignment=true, intrinsics required=false2024.09 | 0.055 | — | — | — | — | — | — | — | — | — | — | — | — | |
| Repurposing DiffusionEncoder=Diffusion2026.03 | 0.055 | — | — | — | — | 96.4 | — | — | — | — | — | — | — | |
| DepthFMEncoder=Diffusion2026.03 | 0.055 | — | — | — | — | 96.3 | — | — | — | — | — | — | — | |
| DepthAnythingSupervised=true, Fine-tuning=true2026.04 | 0.056 | — | 0.206 | 0.024 | — | 98.4 | 99.8 | 100 | — | — | — | — | — | |
| GRINzero_shot=true, require_camera_intrinsics=true2024.09 | 0.058 | — | 0.209 | — | — | 98 | — | — | — | — | — | — | — | |
| DepthAnythingScaling=Linear Fit, Training Dataset=NYUv22024.10 | 0.058 | — | 0.232 | — | 0.025 | 96.5 | 99.3 | 99.7 | — | — | — | — | — | |
| DepthAnything-SScaling=Linear Fit, Training Dataset=NYUv22026.01 | 0.058 | — | 0.232 | — | 0.025 | 96.5 | 99.3 | 99.7 | — | — | — | — | — | |
| DAR-BaseEncoder=Autoregressive2026.03 | 0.058 | 0.013 | 0.214 | — | 0.026 | 98 | 99.7 | 99.9 | — | — | — | — | — | |
| EcoDepthEncoder=ViT-L2026.03 | 0.059 | 0.013 | 0.218 | — | 0.026 | 97.8 | 99.7 | 99.9 | — | — | — | — | — | |
| EVP2023.12 | 0.061 | — | 0.224 | — | 0.027 | 97.6 | 99.7 | 99.9 | — | — | — | — | — | |
| UniDepthzero_shot=true, model_variant=UniDepth-C, require_camera_intrinsics=true2024.09 | 0.063 | — | 0.232 | — | — | 98.4 | — | — | — | — | — | — | — | |
| DepthAnything†Encoder=ViT-L2026.03 | 0.063 | 0.02 | 0.235 | — | 0.026 | 97.5 | 99.7 | 99.9 | — | — | — | — | — | |
| VPD2023.12 | 0.069 | — | 0.254 | — | 0.03 | 96.4 | 99.5 | 99.9 | — | — | — | — | — | |
| VPDEncoder=ViT-L2026.03 | 0.069 | 0.03 | 0.254 | — | 0.027 | 96.4 | 99.5 | 99.9 | — | — | — | — | — | |
| DMD-MIXTraining Domain=Joint indoor-outdoor2023.12 | 0.072 | — | 0.296 | — | 0.031 | 95.3 | 98.9 | 99.6 | — | — | — | — | — | |
| DepthGenArchitecture=Efficient U-Net, Pre-training protocol=unsupervised pretraining and supervised depth pretraining on auxiliary data, Number of samples=22023.02 | 0.074 | — | 0.319 | — | 0.032 | 94.4 | 98.7 | 99.6 | — | — | — | — | — | |
| DepthGenArchitecture=Efficient U-Net, Pre-training protocol=unsupervised pretraining and supervised depth pretraining on auxiliary data, Number of samples=42023.02 | 0.074 | — | 0.315 | — | 0.032 | 94.6 | 98.7 | 99.6 | — | — | — | — | — | |
| DepthGenArchitecture=Efficient U-Net, Pre-training protocol=unsupervised pretraining, Number of samples=82023.02 | 0.074 | — | 0.314 | — | 0.032 | 94.6 | 98.7 | 99.6 | — | — | — | — | — | |
| DDVMArchitecture=Efficient U-Net, unsupervised pretraining=true, auxiliary supervised depth data=true, samples=22023.06 | 0.074 | — | 0.319 | — | 0.032 | 94.4 | 98.7 | 99.6 | — | — | — | — | — | |
| DDVMArchitecture=Efficient U-Net, unsupervised pretraining=true, auxiliary supervised depth data=true, samples=42023.06 | 0.074 | — | 0.315 | — | 0.032 | 94.6 | 98.7 | 99.6 | — | — | — | — | — | |
| DDVMTraining Domain=Domain-specific2023.12 | 0.074 | — | 0.315 | — | 0.032 | 94.6 | 98.7 | 99.6 | — | — | — | — | — | |
| DepthGenArchitecture=Efficient U-Net, Pre-training protocol=unsupervised pretraining and supervised depth pretraining on auxiliary data, Number of samples=12023.02 | 0.075 | — | 0.324 | — | 0.032 | 94.4 | 98.6 | 99.5 | — | — | — | — | — | |
| DDVMArchitecture=Efficient U-Net, unsupervised pretraining=true, auxiliary supervised depth data=true, samples=12023.06 | 0.075 | — | 0.324 | — | 0.032 | 94.4 | 98.6 | 99.5 | — | — | — | — | — | |
| ZoeDepth2023.12 | 0.075 | — | 0.27 | — | 0.032 | 95.5 | 99.5 | 99.9 | — | — | — | — | — | |
| AiT-PArchitecture=SwinV2-L, Pre-training protocol=unsupervised pretraining2023.02 | 0.076 | — | 0.279 | — | 0.033 | 95.3 | 99.3 | 99.9 | — | — | — | — | — | |
| AiT-PArchitecture=SwinV2-L, unsupervised pretraining=true2023.06 | 0.076 | — | 0.279 | — | 0.033 | 95.3 | 99.3 | 99.9 | — | — | — | — | — | |
| AiT2023.12 | 0.076 | — | 0.275 | — | 0.033 | 95.4 | 99.4 | 99.9 | — | — | — | — | — | |
| DMD-NKTraining Domain=Joint indoor-outdoor2023.12 | 0.076 | — | 0.313 | — | 0.033 | 94.4 | 98.6 | 99.6 | — | — | — | — | — | |
| ZoeD-M12-NKTraining Domain=Joint indoor-outdoor2023.12 | 0.077 | — | 0.277 | — | 0.033 | 95.3 | 99.5 | 99.9 | — | — | — | — | — | |
| ZoeDepthScaling=Image, Training Dataset=NYUv22024.10 | 0.077 | — | 0.282 | — | 0.033 | 95.1 | 99.4 | 99.9 | — | — | — | — | — | |
| ZoeDepthScaling=Image, Training Dataset=NYUv22026.01 | 0.077 | — | 0.282 | — | 0.033 | 95.1 | 99.4 | 99.9 | — | — | — | — | — | |
| ZoeDepth†Encoder=ViT-L2026.03 | 0.077 | — | 0.282 | — | 0.033 | 95.1 | 99.4 | 99.9 | — | — | — | — | — | |
| ZeroDepthScaling=DA, Median, Training Dataset=NYUv22024.10 | 0.081 | — | 0.338 | — | — | 92.6 | 98.6 | — | — | — | — | — | — | |
| SS3D + VLRCSelf-Supervised=true, Fine-tuning=NYUv22026.07 | 0.082 | — | 0.407 | 0.044 | — | 86.7 | 97.1 | 99.2 | — | — | — | — | — | |
| MIMArchitecture=SwinV2-L, Pre-training protocol=unsupervised pretraining2023.02 | 0.083 | — | 0.287 | — | 0.035 | 94.9 | 99.4 | 99.9 | — | — | — | — | — | |
| MIMArchitecture=SwinV2-L, unsupervised pretraining=true2023.06 | 0.083 | — | 0.287 | — | 0.035 | 94.9 | 99.4 | 99.9 | — | — | — | — | — | |
| SwinV2Backbone=SwinV2-L2023.12 | 0.083 | — | 0.287 | — | 0.035 | 94.9 | 99.4 | 99.9 | — | — | — | — | — | |
| MIMTraining Domain=Domain-specific2023.12 | 0.083 | — | 0.287 | — | 0.035 | 94.9 | 99.4 | 99.9 | — | — | — | — | — | |
| DCDepthEncoder=Swin-Large2026.03 | 0.085 | 0.039 | 0.304 | — | 0.037 | 94 | 99.2 | 99.8 | — | — | — | — | — | |
| DiffusiongDepthEncoder=Diffusion2026.03 | 0.085 | — | 0.295 | — | 0.036 | 93.9 | 99.2 | 99.9 | — | — | — | — | — | |
| VA-DepthNetBackbone=Swin-L2023.02 | 0.086 | — | 0.304 | 0.108 | — | 93.7 | 99.2 | — | 8.198 | — | — | — | — | |
| SwinV2Backbone=SwinV2-B2023.12 | 0.086 | — | 0.303 | — | 0.037 | 93.8 | 99.2 | 99.8 | — | — | — | — | — | |
| VA-DepthNetEncoder=Swin-Large2026.03 | 0.086 | 0.043 | 0.304 | — | 0.039 | 92.9 | 99.1 | 99.8 | — | — | — | — | — | |
| MGBackbone=Swin-L2023.03 | 0.087 | — | 0.311 | 0.11 | — | 93.3 | — | — | 8.323 | — | — | — | — | |
| IEBinsTraining Domain=Domain-specific2023.12 | 0.087 | — | 0.314 | — | 0.038 | 93.6 | 99.2 | 99.8 | — | — | — | — | — | |
| IEBinsEncoder=Swin-Large2026.03 | 0.087 | 0.04 | 0.314 | — | 0.038 | 93.6 | 99.2 | 99.8 | — | — | — | — | — | |
| NDDepthEncoder=Swin-Large2026.03 | 0.087 | 0.041 | 0.311 | — | 0.038 | 93.6 | 99.1 | 99.8 | — | — | — | — | — | |
| WorDepthEncoder=Swin-Large2026.03 | 0.088 | — | 0.317 | — | 0.038 | 93.2 | 99.2 | 99.8 | — | — | — | — | — | |
| Hybrid Pyramid Feature Fusion (HPF)N=7, scale parameters=[1, 2, 3]2026.04 | 0.088 | 0.04 | 0.316 | 0.114 | — | 93.3 | 99.3 | 99.8 | — | — | — | — | — | |
| OrdinalEntropy2026.04 | 0.089 | — | 0.321 | — | — | 93.2 | — | — | — | — | — | — | — | |
| PixelFormerVenue=Ours, Additional data=false2022.10 | 0.09 | — | 0.322 | — | 0.039 | 92.9 | 99.1 | 99.8 | — | — | — | — | — | |
| PixelFormerArchitecture=Swin-Large, Pre-training protocol=unsupervised pretraining2023.02 | 0.09 | — | 0.322 | — | 0.039 | 92.9 | 99.1 | 99.8 | — | — | — | — | — | |
| PixelFormerArchitecture=Swin-Large, supervised pretraining=true2023.06 | 0.09 | — | 0.322 | — | 0.039 | 92.9 | 99.1 | 99.8 | — | — | — | — | — | |
| PixelFormerTraining Domain=Domain-specific2023.12 | 0.09 | — | 0.322 | — | 0.039 | 92.9 | 99.1 | 99.8 | — | — | — | — | — | |
| PixelFormerEncoder=Swin-Large2026.03 | 0.09 | — | 0.322 | — | 0.039 | 92.9 | 99.1 | 99.8 | — | — | — | — | — | |
| PixelFormer2026.04 | 0.09 | 0.043 | 0.322 | — | — | 92.9 | 99.1 | 99.8 | — | — | — | — | — | |
| SS3DSupervised=false, Fine-tuning=true2026.04 | 0.09 | — | 0.418 | 0.049 | — | 86.6 | 97 | 99.2 | — | — | — | — | — | |
| SS3DSelf-Supervised=true, Fine-tuning=NYUv22026.07 | 0.09 | — | 0.418 | 0.049 | — | 86.6 | 97 | 99.2 | — | — | — | — | — | |
| BinsFormerArchitecture=Swin-Large, Pre-training protocol=unsupervised pretraining2023.02 | 0.094 | — | 0.33 | — | 0.04 | 92.5 | 98.9 | 99.7 | — | — | — | — | — | |
| BinsFormerArchitecture=Swin-Large, supervised pretraining=true2023.06 | 0.094 | — | 0.33 | — | 0.04 | 92.5 | 98.9 | 99.7 | — | — | — | — | — | |
| BinsFormerTraining Domain=Domain-specific2023.12 | 0.094 | — | 0.33 | — | 0.04 | 92.5 | 98.9 | 99.7 | — | — | — | — | — | |
| Metric3Dzero_shot=true, require_camera_intrinsics=true2024.09 | 0.094 | — | 0.337 | — | — | 92.6 | — | — | — | — | — | — | — | |
| DPTScaling=Linear Fit, Training Dataset=NYUv22024.10 | 0.094 | — | 0.332 | — | 0.04 | 92.6 | 99.1 | 99.9 | — | — | — | — | — | |
| DPT-HybridScaling=Linear Fit, Training Dataset=NYUv22026.01 | 0.094 | — | 0.332 | — | 0.04 | 92.6 | 99.1 | 99.9 | — | — | — | — | — | |
| BinsFormerEncoder=Swin-Large2026.03 | 0.094 | — | 0.33 | — | 0.04 | 92.5 | 99.1 | 99.7 | — | — | — | — | — | |
| BinsFormer2026.04 | 0.094 | — | 0.33 | — | — | 92.5 | 98.9 | 99.7 | — | — | — | — | — | |
| DDP2026.04 | 0.094 | — | 0.329 | — | — | 92.1 | 99 | 99.8 | — | — | — | — | — | |
| NeW CRFsAdditional data=false2022.03 | 0.095 | 0.045 | 0.334 | 0.119 | 0.041 | 92.2 | 99.2 | 99.8 | — | — | — | — | — | |
| NeWCRFsVenue=CVPR'22, Additional data=false2022.10 | 0.095 | — | 0.334 | — | 0.041 | 92.2 | 99.2 | 99.8 | — | — | — | — | — | |
| NeWCRFsBackbone=Swin-L2023.02 | 0.095 | — | 0.331 | 0.119 | — | 92.2 | 99.2 | — | 9.102 | — | — | — | — | |
| NeWCRFsBackbone=Swin-L2023.03 | 0.095 | — | 0.331 | 0.119 | — | 92.2 | — | — | 9.102 | — | — | — | — | |
| NeWCRFs2023.12 | 0.095 | — | 0.334 | — | 0.041 | 92.2 | 99.2 | 99.8 | — | — | — | — | — | |
| NeWCRFsTraining Domain=Domain-specific2023.12 | 0.095 | — | 0.334 | — | 0.041 | 92.2 | 99.2 | 99.8 | — | — | — | — | — | |
| NeWCRFszero_shot=false, trained_on_target_dataset=true, require_camera_intrinsics=true2024.09 | 0.095 | — | 0.334 | — | — | 92.2 | — | — | — | — | — | — | — | |
| Language-guided Depth Calibration FrameworkBackbone=DPT-Hybrid, Scaling=Ours, Training Dataset=NYUv22026.01 | 0.095 | — | 0.342 | — | 0.041 | 91.9 | 99.1 | 99.8 | — | — | — | — | — | |
| NeWCRFsEncoder=Swin-Large2026.03 | 0.095 | 0.045 | 0.334 | — | 0.041 | 92.2 | 99.2 | 99.8 | — | — | — | — | — | |
| NeWCRFs2026.04 | 0.095 | 0.045 | 0.334 | 0.119 | — | 92.2 | 99.2 | 99.8 | — | — | — | — | — | |
| DepthFormer2026.04 | 0.096 | — | 0.339 | — | — | 92.1 | 98.9 | 99.8 | — | — | — | — | — | |
| Naderi et al.Venue=WACV'22, Additional data=false2022.10 | 0.097 | — | 0.444 | — | 0.042 | 89.7 | 98.2 | 99.6 | — | — | — | — | — | |
| DPTScaling=Image, Training Dataset=NYUv22024.10 | 0.097 | — | 0.35 | — | 0.042 | 91.4 | 99 | 99.8 | — | — | — | — | — | |
| DPTScaling=RSA (Ours), Training Dataset=NYUv22024.10 | 0.097 | — | 0.347 | — | 0.042 | 91.6 | 99 | 99.8 | — | — | — | — | — | |
| DPT-HybridScaling=Image, Training Dataset=NYUv22026.01 | 0.097 | — | 0.35 | — | 0.042 | 91.4 | 99 | 99.8 | — | — | — | — | — | |
| DPT-HybridScaling=RSA, Training Dataset=NYUv22026.01 | 0.097 | — | 0.347 | — | 0.042 | 91.6 | 99 | 99.8 | — | — | — | — | — | |
| Language-guided Depth Calibration FrameworkBackbone=DPT-Hybrid, Scaling=Ours, Training Dataset=NYUv2,KITTI2026.01 | 0.097 | — | 0.349 | — | 0.041 | 91.6 | 98.9 | 99.8 | — | — | — | — | — | |
| Global-Local Path NetworksParams (M)=622022.01 | 0.098 | — | 0.344 | — | 0.042 | 91.5 | 98.8 | 99.7 | — | — | — | — | — | |
| DPTScaling=Image, Training Dataset=NYUv2, KITTI2024.10 | 0.098 | — | 0.355 | — | 0.043 | 91.1 | 98.9 | 99.8 | — | — | — | — | — | |
| DPT-HybridScaling=Image, Training Dataset=NYUv2,KITTI2026.01 | 0.098 | — | 0.355 | — | 0.043 | 91.1 | 98.9 | 99.8 | — | — | — | — | — | |
| DPTSupervised=true, Zero-shot=true2026.04 | 0.098 | — | — | — | — | 90.3 | — | — | — | — | — | — | — | |
| DPTScaling=RSA (Ours), Training Dataset=NYUv2, KITTI2024.10 | 0.099 | — | 0.352 | — | 0.042 | 91.3 | 98.8 | 99.8 | — | — | — | — | — | |
| DPTScaling=RSA (Ours), Training Dataset=NYUv2, KITTI, VOID2024.10 | 0.099 | — | 0.355 | — | 0.043 | 91.2 | 98.9 | 99.8 | — | — | — | — | — | |
| DPT-HybridScaling=RSA, Training Dataset=NYUv2,KITTI2026.01 | 0.099 | — | 0.352 | — | 0.042 | 91.3 | 98.8 | 99.8 | — | — | — | — | — | |
| LocalBinsEncoder=E-B52026.03 | 0.099 | — | 0.357 | — | 0.042 | 90.7 | 98.7 | 99.8 | — | — | — | — | — | |
| LocalBins2026.04 | 0.099 | — | 0.357 | — | — | 90.7 | 98.7 | 99.8 | — | — | — | — | — |