Monocular Depth Estimation on KITTI Raw Eigen (test)
1.209RMSEraw LiDAR
Evaluation Results
| Method | Links | ||||||||||
|---|---|---|---|---|---|---|---|---|---|---|---|
| raw LiDAR2019.05 | 1.209 | — | — | 0.054 | 99.3 | 99.6 | 99.8 | 0.01 | 0.126 | — | |
| MIMBackbone=SwinV2-L†2023.02 | 1.966 | — | — | 0.075 | 97.7 | 99.8 | 100 | 0.05 | 0.139 | — | |
| PixelFormerBackbone=Swin-Large†2023.02 | 2.081 | — | — | 0.077 | 97.6 | 99.7 | 99.9 | 0.051 | 0.149 | — | |
| BinsFormerBackbone=Swin-Large†2023.02 | 2.098 | — | — | 0.079 | 97.4 | 99.7 | 99.9 | 0.052 | 0.151 | — | |
| DORNcap=0-50 m, Backbone=ResNet2018.06 | 2.271 | 0.071 | 0.268 | 0.116 | 93.6 | 98.5 | 99.5 | — | — | — | |
| AdaBinsBackbone=E-B5+mini-ViT†2023.02 | 2.36 | — | — | 0.088 | 96.4 | 99.5 | 99.9 | 0.058 | 0.19 | — | |
| DORNcap=0-50 m, Backbone=VGG2018.06 | 2.517 | 0.079 | 0.324 | 0.128 | 92 | 98.2 | 99.4 | — | — | — | |
| DPTBackbone=ResNet-50+ViT-B†‡2023.02 | 2.573 | — | — | 0.092 | 95.9 | 99.5 | 99.9 | 0.062 | — | — | |
| PGA-NetBackbone=ResNet-50†2023.02 | 2.634 | — | — | 0.101 | 95.2 | 99.2 | 99.8 | 0.063 | 0.267 | — | |
| Stereo_gt_rightcap=1-50 m2018.03 | 2.675 | 0.058 | 0.316 | 0.152 | 94.7 | 97.1 | 98.3 | — | — | — | |
| DORNcap=0-80 m, Backbone=ResNet2018.06 | 2.727 | 0.072 | 0.307 | 0.12 | 93.2 | 98.4 | 99.4 | — | — | — | |
| DORNBackbone=ResNet-101†2023.02 | 2.727 | — | — | 0.12 | 93.2 | 98.4 | 99.4 | 0.072 | 0.307 | — | |
| TransDepthBackbone=ResNet-50+ViT-B†2023.02 | 2.755 | — | — | 0.098 | 95.6 | 99.4 | 99.9 | 0.064 | 0.252 | — | |
| BTSBackbone=DenseNet-161†2023.02 | 2.756 | — | — | 0.096 | 95.6 | 99.3 | 99.8 | 0.059 | 0.245 | — | |
| DORNtype=S, Dataset=K2019.05 | 2.888 | — | — | 0.12 | 93.8 | 98.6 | 99.5 | 0.08 | 0.332 | — | |
| DepthGenBackbone=Efficient U-Net T‡, samples=82023.02 | 2.985 | — | — | 0.1 | 95.3 | 99.1 | 99.8 | 0.064 | 0.356 | — | |
| DepthGenBackbone=Efficient U-Net T‡, samples=42023.02 | 3.052 | — | — | 0.102 | 95.1 | 99.1 | 99.8 | 0.064 | 0.373 | — | |
| DORNcap=0-80 m, Backbone=VGG2018.06 | 3.056 | 0.081 | 0.376 | 0.132 | 91.5 | 98 | 99.3 | — | — | — | |
| DepthGenBackbone=Efficient U-Net T‡, samples=22023.02 | 3.07 | — | — | 0.102 | 95.1 | 99.1 | 99.8 | 0.064 | 0.378 | — | |
| DepthGenBackbone=Efficient U-Net T‡, samples=12023.02 | 3.104 | — | — | 0.103 | 95.1 | 99.1 | 99.7 | 0.064 | 0.389 | — | |
| VNLBackbone=ResNext-101†2023.02 | 3.258 | — | — | 0.117 | 93.8 | 99 | 99.8 | 0.072 | — | — | |
| Single View Stereo Matchingcap=1-50 m2018.03 | 3.266 | 0.09 | 0.499 | 0.167 | 90.2 | 96.8 | 98.6 | — | — | — | |
| SemiDepth (full)type=Semi, Dataset=C+K2019.05 | 3.464 | — | — | 0.126 | 92.3 | 98.4 | 99.5 | 0.078 | 0.417 | — | |
| Single View Stereo Matching (w/o end-to-end finetuning)cap=1-50 m2018.03 | 3.503 | 0.097 | 0.539 | 0.187 | 88.5 | 96 | 98.1 | — | — | — | |
| Kuznietsov et al.cap=1-50 m2018.03 | 3.518 | 0.108 | 0.595 | 0.179 | 87.5 | 96.4 | 98.8 | — | — | — | |
| Kuznietsov et al.cap=0-50 m2018.06 | 3.518 | 0.108 | 0.595 | 0.179 | 87.5 | 96.4 | 98.8 | — | — | — | |
| SVSM FTtype=Semi, Dataset=I+F+K2019.05 | 3.569 | — | — | 0.127 | 91.9 | 98.3 | 99.5 | 0.077 | 0.392 | — | |
| ACANBackbone=ResNet-1012019.01 | 3.599 | 0.083 | — | 0.127 | 91.9 | 98.2 | 99.5 | — | — | — | |
| Kuznietsov et. al.type=Semi, Dataset=I+K2019.05 | 3.61 | — | — | 0.138 | 90.6 | 98 | 99.5 | 0.089 | 0.478 | — | |
| ACANBackbone=ResNet-502019.01 | 3.637 | 0.085 | — | 0.13 | 91.5 | 98.3 | 99.5 | — | — | — | |
| Stereo_gt_rightcap=0-80 m2018.03 | 3.677 | 0.062 | 0.424 | 0.164 | 93.9 | 96.8 | 98.1 | — | — | — | |
| Godard et al.cap=1-50 m2018.03 | 3.729 | 0.108 | 0.657 | 0.194 | 87.3 | 95.4 | 97.9 | — | — | — | |
| LRC (CS + K)cap=0-50 m, Protocol=Pre-train on Cityscapes and fine tune on KITTI2018.06 | 3.729 | 0.108 | 0.657 | 0.194 | 87.3 | 95.4 | 97.9 | — | — | — | |
| SemiDepthtype=U, Dataset=C+K2019.05 | 3.837 | — | — | 0.134 | 92 | 98 | 99.3 | 0.082 | 0.551 | — | |
| PLADE-NetPost-processing=true, Supervision=S, Training Data=K+CS, Number of Parameters=152021.03 | 3.837 | — | — | 0.167 | 90.8 | 97 | 98.5 | 0.087 | 0.55 | — | |
| PLADE-NetPost-processing=false, Supervision=S, Training Data=K+CS, Number of Parameters=152021.03 | 3.88 | — | — | 0.17 | 90.3 | 96.8 | 98.5 | 0.09 | 0.577 | — | |
| Gan et al.Backbone=ResNet-1012023.02 | 3.933 | — | — | 0.173 | 89 | 96.4 | 98.5 | 0.098 | 0.666 | — | |
| Monodepthtype=U, Dataset=C+K, backbone=ResNet-502019.05 | 3.938 | — | — | 0.135 | 91.6 | 98 | 99.4 | 0.085 | 0.584 | — | |
| SemiDepthtype=S, Dataset=K2019.05 | 3.995 | — | — | 0.152 | 89.2 | 97.2 | 99.2 | 0.096 | 0.552 | — | |
| FAL-netPost-processing=true, Supervision=S, Training Data=K+CS, Number of Parameters=172021.03 | 4.004 | — | — | 0.175 | 89.8 | 96.6 | 98.4 | 0.088 | 0.547 | — | |
| FAL-netPost-processing=true, Supervision=S, Training Data=K, Number of Parameters=172021.03 | 4.005 | — | — | 0.173 | 90 | 96.7 | 98.5 | 0.094 | 0.597 | — | |
| PLADE-NetPost-processing=true, Supervision=S, Training Data=K, Number of Parameters=152021.03 | 4.008 | — | — | 0.172 | 90 | 96.7 | 98.5 | 0.089 | 0.59 | — | |
| PLADE-NetPost-processing=false, Supervision=S, Training Data=K, Number of Parameters=152021.03 | 4.046 | — | — | 0.175 | 89.6 | 96.5 | 98.4 | 0.092 | 0.626 | — | |
| ZhangBackbone=ResNet-502019.01 | 4.082 | 0.136 | — | 0.164 | 86.4 | 96.6 | 98.9 | — | — | — | |
| Gur et al.Post-processing=false, Supervision=DoF, Training Data=K2021.03 | 4.186 | — | — | 0.168 | 88 | 96.6 | 98.8 | 0.11 | 0.666 | — | |
| MonoGANtype=U, Dataset=C+K, backbone=ResNet-502019.05 | 4.236 | — | — | 0.15 | 89.9 | 97.4 | 99.2 | 0.096 | 0.699 | — | |
| Single View Stereo Matchingcap=0-80 m2018.03 | 4.252 | 0.094 | 0.626 | 0.177 | 89.1 | 96.5 | 98.4 | — | — | — | |
| Luo et al.Post-processing=true, Supervision=D+S, Training Data=K2021.03 | 4.252 | — | — | 0.177 | 89.1 | 96.5 | 98.4 | 0.094 | 0.626 | — | |
| Guizilini et al.Post-processing=false, Supervision=V+Se, Training Data=CS-K, Number of Parameters=1402021.03 | 4.27 | — | — | 0.175 | 90.2 | 96.5 | 98.2 | 0.1 | 0.761 | — | |
| monoResMatchSupervision=Stereo, Train set=CS,K, Post-processing=true2019.04 | 4.351 | — | 0.673 | 0.184 | 89 | 96.1 | 98.1 | 0.096 | — | — | |
| Tosi et al.Post-processing=false, Supervision=SSGM, Training Data=CS-K, Number of Parameters=422021.03 | 4.351 | — | — | 0.184 | 89 | 96.1 | 98.1 | 0.096 | 0.673 | — | |
| DeepMatchVOSupervision=No, Dataset=K, Cap (m)=502019.02 | 4.36 | 0.149 | 1.01 | 0.222 | 81.2 | 93.7 | 97.3 | — | — | — | |
| PackNet-SfMSupervision=M, Resolution=1280 x 384, Dataset=CS + K2019.05 | 4.386 | — | — | 0.182 | 89.5 | 96.4 | 98.2 | 0.104 | 0.758 | — | |
| PackNetPost-processing=false, Supervision=V, Training Data=CS-K, Number of Parameters=1202021.03 | 4.386 | — | — | 0.182 | 89.5 | 96.4 | 98.2 | 0.104 | 0.758 | — | |
| DepthHintsPost-processing=false, Supervision=SSGM, Training Data=K, Number of Parameters=352021.03 | 4.393 | — | — | 0.185 | 89 | 96.2 | 98.1 | 0.096 | 0.71 | — | |
| PackNet-SfMSupervision=M + v, Resolution=1280 x 384, Dataset=CS + K2019.05 | 4.404 | — | — | 0.189 | 88.1 | 95.9 | 98 | 0.103 | 0.796 | — | |
| PackNet-SfMSupervision=M, Resolution=640 x 192, Dataset=CS + K2019.05 | 4.426 | — | — | 0.184 | 88.5 | 96.3 | 98.3 | 0.108 | 0.727 | — | |
| Yang et al.Supervision=Seq+Stereo, Train set=Ka, Kr, Ka, Post-processing=true2019.04 | 4.442 | — | 0.734 | 0.187 | 88.8 | 95.8 | 98 | 0.097 | — | — | |
| LiBackbone=ResNet-1522019.01 | 4.513 | 0.104 | — | 0.164 | 86.8 | 96.7 | 99 | — | — | — | |
| LiBackbone=ResNet-1012019.01 | 4.528 | 0.106 | — | — | 85.7 | 96.5 | 98.9 | — | — | — | |
| PackNet-SfMSupervision=M, Resolution=1280 x 384, Dataset=K2019.05 | 4.538 | — | — | 0.186 | 88.9 | 96.2 | 98.1 | 0.107 | 0.802 | — | |
| PackNetPost-processing=false, Supervision=V, Training Data=K, Number of Parameters=1202021.03 | 4.538 | — | — | 0.186 | 88.9 | 96.2 | 98.1 | 0.107 | 0.802 | — | |
| Insta-DMBackbone=ResNet18, Training=C+K(S), Semantic Knowledge=true2021.02 | 4.547 | — | — | 0.184 | 88.3 | 96.2 | 98.3 | 0.109 | 0.74 | — | |
| PackNet-SfMSupervision=M + v, Resolution=1280 x 384, Dataset=K2019.05 | 4.566 | — | — | 0.197 | 87.6 | 95.7 | 97.9 | 0.107 | 0.803 | — | |
| PackNet-SfMSupervision=M, Resolution=640 x 192, Dataset=K2019.05 | 4.601 | — | — | 0.189 | 87.8 | 96 | 98.2 | 0.111 | 0.785 | — | |
| Kuznietsov et al.cap=0-80 m2018.03 | 4.621 | 0.113 | 0.741 | 0.189 | 86.2 | 96 | 98.6 | — | — | — | |
| Kuznietsov et al.cap=0-80 m2018.06 | 4.621 | 0.113 | 0.741 | 0.189 | 86.2 | 96 | 98.6 | — | — | — | |
| PackNet-SfMSupervision=M + v, Resolution=640 x 192, Dataset=CS + K2019.05 | 4.642 | — | — | 0.195 | 87.5 | 95.8 | 98 | 0.108 | 0.803 | — | |
| Pilzer et al. (Teacher)Supervision=Stereo, Train set=CS,K, Post-processing=true2019.04 | 4.656 | — | 0.831 | 0.202 | 88.2 | 94.8 | 97.3 | 0.098 | — | — | |
| Refine&DistillPost-processing=false, Supervision=S, Training Data=K2021.03 | 4.656 | — | — | 0.202 | 88.2 | 94.8 | 97.3 | 0.098 | 0.831 | — | |
| Single View Stereo Matching (w/o end-to-end finetuning)cap=0-80 m2018.03 | 4.681 | 0.102 | 0.7 | 0.2 | 87.2 | 95.4 | 97.8 | — | — | — | |
| SGDepthBackbone=ResNet18, Training=K(S), Semantic Knowledge=true2021.02 | 4.693 | — | — | 0.191 | 87.9 | 96.1 | 98.1 | 0.113 | 0.835 | — | |
| Johnston et al.Backbone=ResNet-101†2023.02 | 4.699 | — | — | 0.185 | 88.9 | 96.2 | 98.2 | 0.106 | 0.861 | — | |
| Monodepth2Supervision=M, Resolution=1024 x 320, Dataset=K2019.05 | 4.701 | — | — | 0.19 | 87.9 | 96.1 | 98.2 | 0.115 | 0.882 | — | |
| Monodepth2Post-processing=false, Supervision=V, Training Data=K, Number of Parameters=142021.03 | 4.701 | — | — | 0.19 | 87.9 | 96.1 | 98.2 | 0.115 | 0.882 | — | |
| CaoBackbone=ResNet-1522019.01 | 4.712 | 0.115 | — | 0.198 | 88.7 | 96.3 | 98.2 | — | — | — | |
| Tosi et al.Post-processing=true, Supervision=SSGM, Training Data=K, Number of Parameters=422021.03 | 4.714 | — | — | 0.199 | 86.4 | 95.4 | 97.9 | 0.111 | 0.867 | — | |
| Insta-DMBackbone=ResNet18, Training=K(S), Semantic Knowledge=true2021.02 | 4.772 | — | — | 0.191 | 87.2 | 95.9 | 98.2 | 0.112 | 0.777 | — | |
| PackNet-SfMSupervision=M + v, Resolution=640 x 192, Dataset=K2019.05 | 4.788 | — | — | 0.199 | 86.4 | 95.4 | 98 | 0.111 | 0.829 | — | |
| 3Net ResNet50Supervision=Stereo, Train set=CS,K, Post-processing=true2019.04 | 4.822 | — | 0.849 | 0.202 | 86.5 | 95.2 | 97.8 | 0.111 | — | — | |
| 3NetPost-processing=false, Supervision=S, Training Data=CS-K, Number of Parameters=482021.03 | 4.822 | — | — | 0.202 | 86.5 | 95.2 | 97.8 | 0.111 | 0.849 | — | |
| Monodepth2Supervision=M, Resolution=640 x 192, Dataset=K2019.05 | 4.863 | — | — | 0.193 | 87.7 | 95.9 | 98.1 | 0.115 | 0.903 | — | |
| Godard et al.cap=0-80 m2018.03 | 4.935 | 0.114 | 0.898 | 0.206 | 86.1 | 94.9 | 97.6 | — | — | — | |
| LRC (CS + K)cap=0-80 m, Protocol=Pre-train on Cityscapes and fine tune on KITTI2018.06 | 4.935 | 0.114 | 0.898 | 0.206 | 86.1 | 94.9 | 97.6 | — | — | — | |
| GodardBackbone=ResNet-502019.01 | 4.935 | 0.114 | — | 0.206 | 86.1 | 94.9 | 97.6 | — | — | — | |
| Godard et al. ResNet50Supervision=Stereo, Train set=CS,K, Post-processing=false2019.04 | 4.935 | — | 0.898 | 0.206 | 86.1 | 94.9 | 97.6 | 0.114 | — | — | |
| Godard et al.Backbone=ResNet-502023.02 | 4.935 | — | — | 0.206 | 86.1 | 94.9 | 97.6 | 0.114 | 0.898 | — | |
| Zhou et al.Supervision=M, Resolution=1248 x 384, Dataset=K, ImageNet pretraining=true2019.05 | 4.945 | — | — | 0.197 | 85.3 | 95.5 | 98.2 | 0.121 | 0.837 | — | |
| SuperDepthPost-processing=false, Supervision=S, Training Data=K2021.03 | 4.958 | — | — | 0.207 | 85.2 | 94.7 | 97.7 | 0.112 | 0.875 | — | |
| Zhou et al.cap=1-50 m2018.03 | 4.975 | 0.19 | 1.436 | 0.258 | 73.5 | 91.5 | 96.8 | — | — | — | |
| Insta-DMBackbone=DispResNet, Training=C+K(S), Semantic Knowledge=true2021.02 | 4.984 | — | — | 0.202 | 85.6 | 95 | 98 | 0.119 | 0.863 | — | |
| EPC++ (stereo)Stereo=true2018.10 | 5.008 | — | — | 0.209 | 84.1 | 94.6 | 97.9 | 0.127 | 0.936 | — | |
| Insta-DMBackbone=DispResNet, Training=K(S), Semantic Knowledge=true2021.02 | 5.061 | — | — | 0.206 | 84.4 | 94.8 | 97.9 | 0.124 | 0.886 | — | |
| Garg et al.cap=1-50 m2018.03 | 5.104 | 0.169 | 1.08 | 0.273 | 74 | 90.4 | 96.2 | — | — | — | |
| Garg et al.cap=0-50 m2018.06 | 5.104 | 0.169 | 1.08 | 0.273 | 74 | 90.4 | 96.2 | — | — | — | |
| Garg2019.01 | 5.104 | 0.169 | — | 0.273 | 74 | 90.4 | 96.2 | — | — | — | |
| Garg et al. [11]Supervision=Stereo (Pose), Dataset=K, Cap (m)=502019.02 | 5.104 | 0.169 | 1.08 | 0.273 | 74 | 90.4 | 96.2 | — | — | — | |
| Gordon et al.Backbone=ResNet18, Training=C+K(S), Semantic Knowledge=true2021.02 | 5.12 | — | — | 0.206 | 85.1 | 95 | 97.8 | 0.124 | 0.93 | — | |
| Gordon et al.Post-processing=false, Supervision=V, Training Data=K+CS2021.03 | 5.12 | — | — | 0.206 | 85.1 | 95 | 97.8 | 0.124 | 0.93 | — | |
| Li et al.Backbone=ResNet18, Training=K, Semantic Knowledge=false2021.02 | 5.138 | — | — | 0.209 | 84.3 | 94.8 | 97.8 | 0.13 | 0.95 | — |