Video Depth Estimation on Sintel (test)
74.7Delta 1 AccuracyDPT-Large
Evaluation Results
| Method | Links | ||||||||||
|---|---|---|---|---|---|---|---|---|---|---|---|
| DPT-LargeBackbone=DPT-Large2023.07 | 74.7 | 87.4 | 91.7 | 19.6 | 67.1 | — | — | — | — | — | |
| MegaSAMEvaluation Protocol=Feed-Forward + Iterative Optimization2025.12 | 74.6 | — | — | 18 | — | — | — | — | — | — | |
| NVDSLargeBackbone=DPT-Large2023.07 | 74.1 | 87.8 | 92.5 | 20.1 | 39.2 | — | — | — | — | — | |
| SelfEvo (VGGT)Align=scale2026.04 | 70.7 | — | — | — | — | 28.3 | — | — | — | — | |
| STream3R-betastreaming=true2025.12 | 70.5 | — | — | — | — | 26.4 | — | — | — | — | |
| SpatialTrackerV2Evaluation Protocol=Feed-Forward + Iterative Optimization2025.12 | 70.3 | — | — | 20 | — | — | — | — | — | — | |
| NVDSLargeBackbone=MiDaS-v2.1-Large2023.07 | 70.1 | 86.7 | 91.8 | 21.5 | 40.3 | — | — | — | — | — | |
| DepthCrafterEvaluation Protocol=Video Depth2025.12 | 69.3 | — | — | 27 | — | — | — | — | — | — | |
| SelfEvo (VGGT)Align=scale&shift2026.04 | 69.2 | — | — | — | — | 21.2 | — | — | — | — | |
| LASER (pi^3)streaming=true, backbone=pi^32025.12 | 68.8 | — | — | — | — | 24.7 | — | — | — | — | |
| VGGTstreaming=false2025.12 | 68.5 | — | — | — | — | 30.3 | — | — | — | — | |
| pi^3streaming=false2025.12 | 68.4 | — | — | — | — | 24.5 | — | — | — | — | |
| VGGTAlign=scale&shift2026.04 | 68.4 | — | — | — | — | 22.7 | — | — | — | — | |
| Any4DEvaluation Protocol=Single-Step Feed-Forward2025.12 | 67.59 | — | — | 24 | — | — | — | — | — | — | |
| VDAEvaluation Protocol=Video Depth2025.12 | 67.4 | — | — | 37 | — | — | — | — | — | — | |
| Robust-CVD2023.07 | 67.3 | 84.8 | 88.8 | 28.4 | 44.7 | — | — | — | — | — | |
| MiDaS-v2.1-LargeBackbone=MiDaS-v2.1-Large2023.07 | 67 | 85.3 | 90.2 | 24.6 | 71.2 | — | — | — | — | — | |
| VGGTEvaluation Protocol=Single-Step Feed-Forward2025.12 | 65.9 | — | — | 24 | — | — | — | — | — | — | |
| MapAnythingEvaluation Protocol=Single-Step Feed-Forward2025.12 | 65.87 | — | — | 25 | — | — | — | — | — | — | |
| StreamVGGTstreaming=true2025.12 | 65.7 | — | — | — | — | 32.3 | — | — | — | — | |
| LASER (VGGT)streaming=true, backbone=VGGT2025.12 | 64.6 | — | — | — | — | 29.7 | — | — | — | — | |
| VGGTAlign=scale2026.04 | 64.1 | — | — | — | — | 30 | — | — | — | — | |
| WSVD2023.07 | 62.1 | 82.2 | 89.1 | 30.5 | 58.1 | — | — | — | — | — | |
| DPT-Largeevaluation_scope=23 videos2023.07 | 59.7 | 76.8 | 84.6 | 33.9 | 61.2 | — | — | — | — | — | |
| DPT-LargeType=Single Image2023.07 | 59.7 | — | — | 33.9 | 61.2 | — | — | — | — | — | |
| MonST3REvaluation Protocol=Feed-Forward + Iterative Optimization2025.12 | 59.4 | — | — | 34 | — | — | — | — | — | — | |
| NVDSPlusBackbone=DPT-Large, Evaluation_Scope=23 videos2023.07 | 59.1 | 77 | 84.9 | 33.5 | 40.3 | — | — | — | — | — | |
| NVDS+Type=Learning Based, Backbone=DPT-Large2023.07 | 59.1 | — | — | 33.5 | 40.3 | — | — | — | — | — | |
| DUSt3REvaluation Protocol=Feed-Forward + Iterative Optimization2025.12 | 59.1 | — | — | 48 | — | — | — | — | — | — | |
| VGGT-SLAMstreaming=true2025.12 | 56 | — | — | — | — | 42.4 | — | — | — | — | |
| CUT3REvaluation Protocol=Single-Step Feed-Forward2025.12 | 56 | — | — | 47 | — | — | — | — | — | — | |
| VITAType=Learning Based2023.07 | 55.4 | — | — | 37.6 | 49.2 | — | — | — | — | — | |
| NVDSPlusBackbone=MiDaS-v2.1-Large, Evaluation_Scope=23 videos2023.07 | 53.2 | 73.1 | 83.3 | 37.2 | 44.7 | — | — | — | — | — | |
| NVDS+Type=Learning Based, Backbone=MiDaS-v2.1-Large2023.07 | 53.2 | — | — | 37.2 | 44.7 | — | — | — | — | — | |
| Zhang et al.evaluation_scope=12 videos2023.07 | 52.2 | 72.7 | 83.1 | 34.2 | 48.1 | — | — | — | — | — | |
| Zhang et al.Type=Test-time Training2023.07 | 52.2 | — | — | 34.2 | 48.1 | — | — | — | — | — | |
| Zhang et al.2023.07 | 52.2 | 72.7 | 83.1 | 34.2 | 48.1 | — | — | — | — | — | |
| Robust-CVDevaluation_scope=23 videos2023.07 | 52.1 | 72.7 | 83.3 | 42.2 | 47.5 | — | — | — | — | — | |
| Robust-CVDType=Test-time Training2023.07 | 52.1 | — | — | 42.2 | 47.5 | — | — | — | — | — | |
| CVDevaluation_scope=12 videos2023.07 | 51.8 | 74.1 | 83.2 | 40.6 | 49.7 | — | — | — | — | — | |
| CVDType=Test-time Training2023.07 | 51.8 | — | — | 40.6 | 49.7 | — | — | — | — | — | |
| CVD2023.07 | 51.8 | 74.1 | 83.2 | 40.6 | 49.7 | — | — | — | — | — | |
| DeepV2D2023.07 | 50.9 | 73.5 | 82.7 | 38.4 | 57.5 | — | — | — | — | — | |
| WinT3Rstreaming=true2025.12 | 50.6 | — | — | — | — | 37.4 | — | — | — | — | |
| WSVDevaluation_scope=23 videos2023.07 | 50.1 | 70.9 | 80.4 | 43.9 | 57.7 | — | — | — | — | — | |
| WSVDType=Learning Based2023.07 | 50.1 | — | — | 43.9 | 57.7 | — | — | — | — | — | |
| TTT3Rstreaming=true2025.12 | 50 | — | — | — | — | 40.4 | — | — | — | — | |
| FMNet2023.07 | 49.2 | 72.8 | 82.5 | 36.3 | 51.6 | — | — | — | — | — | |
| Point3Rstreaming=true2025.12 | 48.9 | — | — | — | — | 45.2 | — | — | — | — | |
| DeepV2Devaluation_scope=23 videos2023.07 | 48.6 | 67.4 | 76 | 52.6 | 53.4 | — | — | — | — | — | |
| DeepV2DType=Learning Based2023.07 | 48.6 | — | — | 52.6 | 53.4 | — | — | — | — | — | |
| MiDaS-v2.1-Largeevaluation_scope=23 videos2023.07 | 48.5 | 69.3 | 78.7 | 41 | 84.3 | — | — | — | — | — | |
| MiDaS-v2.1-LargeType=Single Image2023.07 | 48.5 | — | — | 41 | 84.3 | — | — | — | — | — | |
| CUT3Rstreaming=true2025.12 | 47.9 | — | — | — | — | 42.1 | — | — | — | — | |
| ST-CLSTM2023.07 | 47.7 | 71.1 | 82.7 | 36.6 | 54.7 | — | — | — | — | — | |
| Li et al.Type=Learning Based2023.07 | 47.3 | — | — | 38.9 | — | — | — | — | — | — | |
| Spann3Rstreaming=true2025.12 | 42.6 | — | — | — | — | 62.2 | — | — | — | — | |
| FMNetevaluation_scope=23 videos2023.07 | 35.7 | 57.9 | 71.2 | 51.3 | 52.1 | — | — | — | — | — | |
| FMNetType=Learning Based2023.07 | 35.7 | — | — | 51.3 | 52.1 | — | — | — | — | — | |
| ST-CLSTMevaluation_scope=23 videos2023.07 | 35.1 | 57.1 | 70.6 | 51.7 | 58.5 | — | — | — | — | — | |
| ST-CLSTMType=Learning Based2023.07 | 35.1 | — | — | 51.7 | 58.5 | — | — | — | — | — | |
| DAv2-BType=Image to Depth2026.04 | — | — | — | — | — | — | 72 | 13.8 | 13.8 | — | |
| DAv2-B + NVDSType=Post-processing2026.04 | — | — | — | — | — | — | 2 | 552.7 | 13.8 | 538.8 | |
| DAv2-B + VDPPType=Post-processing2026.04 | — | — | — | — | — | — | 63 | 15.9 | 13.8 | 2 | |
| DAv2-LType=Image to Depth2026.04 | — | — | — | — | — | — | 38 | 26.1 | 26.1 | — | |
| DAv2-L + NVDSType=Post-processing2026.04 | — | — | — | — | — | — | 2 | 564.9 | 26.1 | 538.8 | |
| DAv2-L + VDPPType=Post-processing2026.04 | — | — | — | — | — | — | 36 | 28.1 | 26.1 | 2 | |
| DPT-LType=Image to Depth2026.04 | — | — | — | — | — | — | 63 | 15.9 | 15.9 | — | |
| DPT-L + NVDSType=Post-processing2026.04 | — | — | — | — | — | — | 2 | 554.8 | 15.9 | 538.8 | |
| DPT-L + VDPPType=Post-processing2026.04 | — | — | — | — | — | — | 56 | 18 | 15.9 | 2 | |
| VDA-LType=End-to-end2026.04 | — | — | — | — | — | — | 6 | 166.2 | — | — | |
| VDA-SType=End-to-end2026.04 | — | — | — | — | — | — | 53 | 18.8 | — | — |