Depth Estimation on KITTI (Eigen split)
1.65RMSESQLdepth
Evaluation Results
| Method | Links | |||||||||
|---|---|---|---|---|---|---|---|---|---|---|
| SQLdepthBackbone=ConvNeXt-L, Params=242M, Train=SSL+Sup, Test=median-scaling, HxW=376x12412023.09 | 1.65 | 0.035 | 0.092 | 0.057 | 98.9 | 99.8 | 99.9 | — | — | |
| SQLdepthBackbone=ConvNeXt-L, Params=242M, Train=SSL+Sup, Test=Standard, HxW=376x12412023.09 | 1.698 | 0.043 | 0.105 | 0.064 | 98.3 | 99.8 | 99.9 | — | — | |
| FutureDepthType=MF, Encoder=Dinov2 (ViT-L)2024.03 | 1.856 | 0.041 | 0.117 | 0.066 | 98.4 | — | — | — | — | |
| PixelFormer+MAMoType=VD, Encoder=Swin-large2023.07 | 1.884 | 0.049 | 0.13 | 0.072 | 97.7 | 0.998 | 0.9995 | — | — | |
| Deep Two-View SfMType=II (Deep SfM)2021.04 | 1.919 | 0.034 | 0.103 | 0.057 | 98.9 | 99.8 | 99.9 | 0.031 | — | |
| FutureDepthType=MF, Encoder=Swin-L2024.03 | 1.92 | 0.044 | 0.119 | 0.068 | 98.3 | — | — | — | — | |
| BTS (Ours-ResNext)cap=0-50m, Backbone=ResNext-1012019.07 | 1.925 | 0.056 | 0.169 | 0.087 | 96.4 | 99.4 | 99.9 | — | — | |
| BTS (Ours-DenseNet)cap=0-50m, Backbone=DenseNet-1612019.07 | 1.949 | 0.057 | 0.175 | 0.088 | 96.4 | 99.5 | 99.9 | — | — | |
| SwinV2-L 1K-MIMParams=254M, Train=Sup, Test=Standard, HxW=376x12412023.09 | 1.966 | 0.05 | 0.139 | 0.075 | 97.7 | 99.8 | 100 | — | — | |
| MAMOType=MF, Encoder=Swin-L2024.03 | 1.989 | 0.049 | 0.13 | 0.072 | 97.7 | — | — | — | — | |
| BTS (Ours-ResNet)cap=0-50m, Backbone=ResNet-1012019.07 | 1.995 | 0.058 | 0.183 | 0.09 | 96.2 | 99.4 | 99.9 | — | — | |
| FutureDepthType=MF, Encoder=Swin-B2024.03 | 1.998 | 0.049 | 0.129 | 0.077 | 97.6 | — | — | — | — | |
| NeWCRFs+MAMoType=VD, Encoder=Swin-large2023.07 | 2.003 | 0.05 | 0.141 | 0.076 | 97.7 | 0.998 | 0.9994 | — | — | |
| SQLdepthBackbone=Efficient-b5, Params=78M, Train=SSL+Sup, Test=median-scaling, HxW=376x12412023.09 | 2.009 | 0.044 | 0.128 | 0.07 | 98.1 | 99.7 | 99.9 | — | — | |
| FutureDepthType=MF, Encoder=ResNet342024.03 | 2.016 | 0.054 | 0.179 | 0.087 | 96.5 | — | — | — | — | |
| LiftFormerdepth_range=0–80 M2026.04 | 2.038 | 0.05 | 0.143 | 0.076 | 97.8 | 99.8 | 99.9 | — | — | |
| DCDepthBackbone=Swin-Large2024.10 | 2.044 | 0.051 | 0.145 | 0.076 | 97.7 | 99.7 | 99.9 | — | — | |
| GEDepthType=SF, Encoder=[24]2024.03 | 2.05 | 0.048 | 0.142 | 0.076 | 97.6 | — | — | — | — | |
| BaselineType=MF, Encoder=Dinov2 (ViT-L)2024.03 | 2.064 | 0.051 | 0.141 | 0.076 | 97.9 | — | — | — | — | |
| iDiscBackbone=Swin-Large2024.10 | 2.067 | 0.05 | 0.145 | 0.077 | 97.7 | 99.7 | 99.9 | — | — | |
| iDiscType=SF, Encoder=Swin-L2024.03 | 2.067 | 0.05 | 0.145 | 0.077 | 97.7 | — | — | — | — | |
| iDiscdepth_range=0–80 M2026.04 | 2.067 | 0.05 | 0.145 | 0.077 | 97.7 | 99.7 | 99.9 | — | -1.43 | |
| DDPdepth_range=0–80 M2026.04 | 2.072 | 0.05 | 0.148 | 0.076 | 97.5 | 99.7 | 99.9 | — | -1.67 | |
| PixelFormerBackbone=Swin-Large2024.10 | 2.081 | 0.051 | 0.149 | 0.077 | 97.6 | 99.7 | 99.9 | — | — | |
| PixelFormerType=SF, Encoder=Swin-L2024.03 | 2.081 | 0.051 | 0.149 | 0.077 | 97.6 | — | — | — | — | |
| PixelFormerdepth_range=0–80 M2026.04 | 2.081 | 0.051 | 0.149 | 0.077 | 97.6 | 99.7 | 99.9 | — | -2.11 | |
| NeWCRFs+MAMoType=VD, Encoder=Swin-Base2023.07 | 2.09 | 0.051 | 0.149 | 0.078 | 97.6 | 0.998 | 0.9994 | — | — | |
| VA-DepthNetBackbone=Swin-Large2024.10 | 2.093 | 0.05 | 0.148 | 0.076 | 97.7 | 99.7 | 99.9 | — | — | |
| PixelFormerType=VD, Encoder=Swin-large2023.07 | 2.093 | 0.052 | 0.152 | 0.079 | 97.5 | 0.997 | 0.9994 | — | — | |
| BaselineType=MF, Encoder=Swin-L2024.03 | 2.094 | 0.053 | 0.154 | 0.079 | 97.5 | — | — | — | — | |
| BinsFormerBackbone=Swin-Large2024.10 | 2.096 | 0.052 | 0.151 | 0.079 | 97.4 | 99.7 | 99.9 | — | — | |
| BinsFormerType=SF, Encoder=Swin-large2023.07 | 2.098 | 0.052 | 0.151 | 0.079 | 97.5 | 0.997 | 0.9992 | — | — | |
| BinsFormerType=SF, Encoder=Swin-L2024.03 | 2.098 | 0.052 | 0.151 | 0.079 | 97.5 | — | — | — | — | |
| BinsFormerdepth_range=0–80 M2026.04 | 2.098 | 0.052 | 0.151 | 0.079 | 97.4 | 99.7 | 99.9 | — | -2.944 | |
| NVDSType=MF, Encoder=DPT-L [36]2024.03 | 2.101 | 0.052 | 0.159 | 0.077 | 97.6 | — | — | — | — | |
| DINOv2depth_range=0–80 M2026.04 | 2.111 | 0.065 | 0.179 | 0.088 | 96.8 | 99.7 | 99.9 | — | -3.582 | |
| NeWCRFsType=VD, Encoder=Swin-large2023.07 | 2.118 | 0.053 | 0.154 | 0.08 | 97.4 | 0.997 | 0.9994 | — | — | |
| SC-GANMulti-view=true2021.12 | 2.129 | 0.063 | 0.178 | 0.097 | 96.1 | — | — | — | — | |
| SQLdepthBackbone=Efficient-b5, Params=78M, Train=SSL+Sup, Test=Standard, HxW=376x12412023.09 | 2.129 | 0.058 | 0.163 | 0.082 | 97.1 | 99.5 | 99.9 | — | — | |
| NeWCRFsParams=270M, Train=Sup, Test=Standard, HxW=376x12412023.09 | 2.129 | 0.052 | 0.155 | 0.079 | 97.4 | 99.7 | 99.9 | — | — | |
| NeWCRFSBackbone=Swin-Large2024.10 | 2.129 | 0.052 | 0.155 | 0.079 | 97.4 | 99.7 | 99.9 | — | — | |
| NeWCRFsType=SF, Encoder=Swin-L2024.03 | 2.129 | 0.052 | 0.155 | 0.079 | 97.4 | — | — | — | — | |
| NeWCRFsdepth_range=0–80 M2026.04 | 2.129 | 0.052 | 0.155 | 0.079 | 97.4 | 99.7 | 99.9 | — | -4.465 | |
| NeWCRFsType=VD, Encoder=Swin-Base2023.07 | 2.14 | 0.054 | 0.157 | 0.081 | 97.3 | 0.997 | 0.9993 | — | — | |
| DepthFormerdepth_range=0–80 M2026.04 | 2.143 | 0.052 | 0.158 | 0.079 | 97.5 | 99.7 | 99.8 | — | -5.152 | |
| MaGNet (full)Multi-view=true2021.12 | 2.158 | 0.054 | 0.162 | 0.083 | 97.1 | — | — | — | — | |
| BaselineType=MF, Encoder=Swin-B2024.03 | 2.163 | 0.055 | 0.162 | 0.082 | 97.3 | — | — | — | — | |
| Fu et al.cap=0-50m2019.07 | 2.271 | 0.071 | 0.268 | 0.116 | 93.6 | 98.5 | 99.5 | — | — | |
| Deep Two-View SfMType=II (Deep SfM)2021.04 | 2.273 | 0.055 | 0.224 | 0.091 | 0.956 | 0.984 | 0.993 | 0.107 | — | |
| Wang et al.depth_range=0–80 M2026.04 | 2.273 | 0.055 | 0.224 | — | — | — | — | — | -11.531 | |
| DepthFormerType=SF, Encoder=MiT-B42023.07 | 2.285 | 0.058 | 0.187 | 0.087 | 96.7 | 0.996 | 0.9991 | — | — | |
| ZoeDepthParams=345M, Train=Sup, Test=Standard, HxW=376x12412023.09 | 2.29 | 0.057 | 0.194 | 0.091 | 96.7 | 99.5 | 99.9 | — | — | |
| AdaBinsMulti-view=false2021.12 | 2.36 | 0.058 | 0.19 | 0.088 | 96.4 | — | — | — | — | |
| AdaBinsParams=78M, Train=Sup, Test=Standard, HxW=376x12412023.09 | 2.36 | 0.058 | 0.19 | 0.088 | 96.4 | 99.5 | 99.9 | — | — | |
| AdaBinsBackbone=E-B5+mini-ViT2024.10 | 2.36 | 0.058 | 0.19 | 0.088 | 96.4 | 99.5 | 99.9 | — | — | |
| AdaBinsType=SF, Encoder=EfficientNet-B5+mViT2023.07 | 2.36 | 0.058 | 0.19 | 0.088 | 96.4 | 0.995 | 0.9991 | — | — | |
| AdaBinsType=SF, Encoder=EfficientNet2024.03 | 2.36 | 0.058 | 0.19 | 0.088 | 96.4 | — | — | — | — | |
| Adabindepth_range=0–80 M2026.04 | 2.36 | 0.058 | 0.19 | 0.088 | 96.4 | 99.5 | 99.9 | — | -15.8 | |
| MaGNet (D-Net)Multi-view=false2021.12 | 2.422 | 0.061 | 0.209 | 0.092 | 96 | — | — | — | — | |
| DeepV2DType=II (Deep SfM)2021.04 | 2.483 | 0.05 | 0.212 | 0.089 | 97.3 | 99.2 | 99.7 | 0.091 | — | |
| BaselineType=MF, Encoder=ResNet342024.03 | 2.521 | 0.063 | 0.219 | 0.098 | 95.7 | — | — | — | — | |
| DPT-HybridTraining=Fine-tuned2021.03 | 2.573 | 0.062 | — | 0.092 | 95.9 | 99.5 | 99.9 | — | — | |
| DORNTraining=Fine-tuned2021.03 | 2.626 | 0.072 | — | 0.12 | 93.2 | 98.4 | 99.4 | — | — | |
| DORNTrain=D2018.06 | 2.727 | 0.072 | 0.307 | 0.12 | 93.2 | 98.4 | 99.4 | — | — | |
| DORNType=S (Supervised single frame)2021.04 | 2.727 | 0.072 | 0.307 | 0.12 | 0.932 | 0.984 | 0.994 | 0.163 | — | |
| Fu et al.cap=0-80m2019.07 | 2.727 | 0.072 | 0.307 | 0.12 | 93.2 | 98.4 | 99.4 | — | — | |
| DORNBackbone=ResNet-1012024.10 | 2.727 | 0.072 | 0.307 | 0.12 | 93.2 | 98.4 | 99.4 | — | — | |
| DORNdepth_range=0–80 M2026.04 | 2.727 | 0.072 | 0.307 | 0.12 | 93.2 | 98.4 | 99.5 | — | -33.808 | |
| ManyDepth-FSType=MF, Encoder=Swin-large, Supervision=Fully-supervised2023.07 | 2.747 | 0.06 | 0.248 | 0.099 | 95.5 | 0.993 | 0.9981 | — | — | |
| ManyDepth-FSType=MF, Encoder=Swin-L2024.03 | 2.747 | 0.06 | 0.248 | 0.099 | 95.5 | — | — | — | — | |
| TransDepthBackbone=R-50+ViT-B/162024.10 | 2.755 | 0.064 | 0.252 | 0.098 | 95.6 | 99.4 | 99.9 | — | — | |
| BTSTraining=Fine-tuned2021.03 | 2.756 | 0.059 | — | 0.096 | 95.6 | 99.3 | 99.8 | — | — | |
| BTS (Ours-ResNext)cap=0-80m, Backbone=ResNext-1012019.07 | 2.756 | 0.059 | 0.245 | 0.096 | 95.6 | 99.3 | 99.8 | — | — | |
| BTSMulti-view=false2021.12 | 2.756 | 0.059 | 0.245 | 0.096 | 95.6 | — | — | — | — | |
| BTS (Ours-DenseNet)cap=0-80m, Backbone=DenseNet-1612019.07 | 2.798 | 0.06 | 0.249 | 0.096 | 95.5 | 99.3 | 99.8 | — | — | |
| BTSBackbone=DenseNet-1612024.10 | 2.798 | 0.06 | 0.249 | 0.096 | 95.5 | 99.3 | 99.8 | — | — | |
| NeuralRGBType=MF, Encoder=CNN based, Multiple networks=true2023.07 | 2.829 | 0.1 | — | — | 93.1 | — | — | — | — | |
| NeuralRGBType=MF, Encoder=CNN-based†2024.03 | 2.829 | 0.1 | — | — | 93.1 | — | — | — | — | |
| BTS (Ours-ResNet)cap=0-80m, Backbone=ResNet-1012019.07 | 2.834 | 0.061 | 0.261 | 0.099 | 95.4 | 99.2 | 99.8 | — | — | |
| BTSParams=47M, Train=Sup, Test=Standard, HxW=376x12412023.09 | 2.834 | 0.061 | 0.261 | 0.099 | 95.4 | 99.2 | 99.8 | — | — | |
| P3DepthBackbone=ResNet-1012024.10 | 2.842 | 0.071 | 0.27 | 0.103 | 95.3 | 99.3 | 99.8 | — | — | |
| P3Depthdepth_range=0–80 M2026.04 | 2.842 | 0.071 | 0.27 | 0.103 | 95.3 | 99.3 | 99.8 | — | -39.45 | |
| DORNType=S (Supervised single frame)2021.04 | 2.929 | 0.067 | 0.295 | 0.108 | 94.9 | 98.8 | 99.5 | 0.13 | — | |
| DeepV2DType=II (Deep SfM)2021.04 | 2.946 | 0.064 | 0.35 | 0.12 | 0.946 | 0.982 | 0.991 | 0.142 | — | |
| ResNet-DPT+MAMoType=VD, Encoder=ResNet502023.07 | 2.984 | 0.071 | 0.301 | 0.121 | 92.6 | 0.99 | 0.9971 | — | — | |
| Structure-Attentioned Memory Network2019.09 | 3.007 | 0.097 | 0.398 | 0.133 | 91.3 | 98.5 | 99.7 | — | — | |
| Focal-Wnetdepth_range=0–80 M2026.04 | 3.076 | 0.082 | — | 0.12 | 92.6 | 98.6 | 99.7 | — | -50.932 | |
| Gan et al.cap=0-50m2019.07 | 3.133 | 0.094 | 0.552 | 0.165 | 89.8 | 96.7 | 98.6 | — | — | |
| VNLType=S (Supervised single frame)2021.04 | 3.172 | 0.065 | 0.297 | 0.106 | 94.5 | 98.9 | 99.7 | 0.168 | — | |
| TC-Depth-FSType=MF, Encoder=ResNet50, Supervision=Fully-supervised2023.07 | 3.222 | 0.071 | 0.33 | 0.108 | 92.2 | 0.993 | 0.997 | — | — | |
| TC-Depth-FSType=MF, Encoder=ResNet502024.03 | 3.222 | 0.071 | 0.33 | 0.108 | 92.2 | — | — | — | — | |
| Naderi et al.depth_range=0–80 M2026.04 | 3.223 | 0.07 | — | — | 94.4 | 99.1 | 99.8 | — | -58.145 | |
| ResNet-DPTType=VD, Encoder=ResNet502023.07 | 3.242 | 0.085 | 0.383 | 0.13 | 91.3 | 0.981 | 0.996 | — | — | |
| VNLTraining=Fine-tuned2021.03 | 3.258 | 0.072 | — | 0.117 | 93.8 | 99 | 99.8 | — | — | |
| VNLType=S (Supervised single frame)2021.04 | 3.258 | 0.072 | — | 0.117 | 0.938 | 0.99 | 0.998 | 0.176 | — | |
| Yin et al.cap=0-80m2019.07 | 3.258 | 0.072 | — | 0.117 | 93.8 | 99 | 99.8 | — | — | |
| VNLBackbone=ResNet-1012024.10 | 3.258 | 0.072 | — | 0.117 | 93.8 | 99 | 99.8 | — | — | |
| STADType=MF, Encoder=CNN, Multiple networks=true2023.07 | 3.312 | 0.109 | 0.594 | 0.153 | 88.9 | 0.971 | 0.989 | — | — | |
| STADType=MF, Encoder=[26]†2024.03 | 3.312 | 0.109 | 0.594 | 0.153 | 88.9 | — | — | — | — | |
| UnOSStereo Train=true, Stereo Infer.=true, Multi-Frame=false2023.10 | 3.404 | 0.049 | 0.515 | 0.121 | 96.5 | 98.4 | 99.2 | — | — |