3D Object Detection on nuScenes
71.7mAP (All)GraphBEV
Evaluation Results
| Method | Links | ||||||||||||||||||||||||||||||||||
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| GraphBEVModality=LiDAR + Camera2026.05 | 71.7 | — | — | — | — | — | — | — | — | — | — | 73.6 | — | — | — | — | — | — | — | — | — | — | — | 10 | 90 | — | — | — | — | — | — | — | — | — | |
| InfoCoordiBridgeICA=true, Modality=LiDAR + Camera2026.05 | 70.9 | — | — | — | — | — | — | — | — | — | — | 73.2 | — | — | — | — | — | — | — | — | — | — | — | 0.7 | 98 | — | — | — | — | — | — | — | — | — | |
| FSFModality=LiDAR + Camera2026.05 | 70.4 | — | — | — | — | — | — | — | — | — | — | 72.7 | — | — | — | — | — | — | — | — | — | — | — | 12 | 88 | — | — | — | — | — | — | — | — | — | |
| BEVFusionModality=LiDAR + Camera2026.05 | 70.2 | — | — | — | — | — | — | — | — | — | — | 72.9 | — | — | — | — | — | — | — | — | — | — | — | 15 | 85 | — | — | — | — | — | — | — | — | — | |
| Multi-Modal Decouple and Recouple NetworkFLOPs=140 GFLOPs, FPS=3.92026.03 | 69.5 | — | — | — | — | — | — | — | — | — | — | 72 | — | — | — | — | — | — | 81.7 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| TransFusionModality=LiDAR + Camera2026.05 | 68.9 | — | — | — | — | — | — | — | — | — | — | 71.7 | — | — | — | — | — | — | — | — | — | — | — | 18 | 82 | — | — | — | — | — | — | — | — | — | |
| MetaBEVFLOPs=157 GFLOPs, FPS=3.72026.03 | 68.6 | — | — | — | — | — | — | — | — | — | — | 71.3 | — | — | — | — | — | — | 77.9 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| BEVFusionFLOPs=115 GFLOPs, FPS=4.02026.03 | 68.5 | — | — | — | — | — | — | — | — | — | — | 71 | — | — | — | — | — | — | 77.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| RoPETRModality=Camera2026.05 | 64.8 | — | — | — | — | — | — | — | — | — | — | 70.9 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| CenterPointModality=LiDAR2026.05 | 60.3 | — | — | — | — | — | — | — | — | — | — | 67.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| InfoCoordiBridgeICA=false, Modality=LiDAR + Camera2026.05 | 58 | — | — | — | — | — | — | — | — | — | — | 63 | — | — | — | — | — | — | — | — | — | — | — | 25 | 75 | — | — | — | — | — | — | — | — | — | |
| RCT-AD-LBackbone=R1012026.07 | 52.9 | — | — | — | — | — | — | — | — | — | — | 61.5 | 79.1 | — | 72.5 | — | — | — | — | — | — | — | — | — | — | — | 47.9 | 52.2 | — | — | 63.6 | 62.2 | 69.7 | 81.8 | |
| LaGen2025.11 | 52 | — | — | — | — | — | — | — | — | — | — | 49 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| UniScene2025.11 | 51 | — | — | — | — | — | — | — | — | — | — | 47 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| BridgeAD-BBackbone=R1012026.07 | 50.7 | — | — | — | — | — | — | — | — | — | — | 59.4 | 76.2 | — | 67.4 | — | — | — | — | — | — | — | — | — | — | — | 47.2 | 49.8 | — | — | 59.1 | 61.9 | 68.3 | 77.1 | |
| OpenDWM2025.11 | 45 | — | — | — | — | — | — | — | — | — | — | 47 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| RCT-AD-TBackbone=R502026.07 | 44.2 | — | — | — | — | — | — | — | — | — | — | 55.6 | 65.7 | — | 58.1 | — | — | — | — | — | — | — | — | — | — | — | 49.1 | 49.7 | — | — | 52.6 | 53.2 | 47.1 | 66.9 | |
| BridgeAD-SBackbone=R502026.07 | 42.3 | — | — | — | — | — | — | — | — | — | — | 53.4 | 64.3 | — | 53.3 | — | — | — | — | — | — | — | — | — | — | — | 44.8 | 49.2 | — | — | 51.7 | 50.6 | 46.7 | 62.4 | |
| SparseDrive+Backbone=R50, Official Evaluation=true2026.07 | 41.8 | — | — | — | — | — | — | — | — | — | — | 52.5 | 59.8 | — | 52.7 | — | — | — | — | — | — | — | — | — | — | — | 44.2 | 49.1 | — | — | 51.4 | 52.3 | 47.4 | 61.1 | |
| BEVFormerBackbone=R1012026.07 | 41.6 | — | — | — | — | — | — | — | — | — | — | 51.7 | 59.6 | — | 51.9 | — | — | — | — | — | — | — | — | — | — | — | 44.4 | 48.8 | — | — | 50.8 | 51.2 | 47.5 | 61.8 | |
| LiDARCrafter2025.11 | 41 | — | — | — | — | — | — | — | — | — | — | 41 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| UniADBackbone=R1012026.07 | 38 | — | — | — | — | — | — | — | — | — | — | 49.8 | 53.4 | — | 47.2 | — | — | — | — | — | — | — | — | — | — | — | 39.5 | 42.9 | — | — | 45.3 | 50.1 | 46.3 | 55.3 | |
| ori nuScenes2026.07 | 37.98 | — | — | — | — | — | — | — | — | — | — | 49.85 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| CoIn3DTraining Strategy=Joint Mix, Detector Framework=BEVDepth2026.03 | 35.8 | — | — | — | — | — | — | — | — | — | — | 44.1 | 54.2 | 69.3 | 32.1 | 36 | 21.1 | 27 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| ScaleBEVTraining Strategy=Joint Mix, Detector Framework=BEVDet2026.03 | 29.3 | — | — | — | — | — | — | — | — | — | — | 35.8 | 44.7 | 54 | 24.6 | 27.5 | 18.5 | 25.8 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| VAD+Backbone=R50, Official Evaluation=true2026.07 | 27.3 | — | — | — | — | — | — | — | — | — | — | 39.7 | 44.5 | — | 38.7 | — | — | — | — | — | — | — | — | — | — | — | 18.6 | 32.1 | — | — | 23.1 | 41.4 | 27.4 | 47.2 | |
| Direct MixTraining Strategy=Joint Mix, Detector Framework=BEVDepth2026.03 | 26.7 | — | — | — | — | — | — | — | — | — | — | 35 | 41.1 | 53.7 | 21.3 | 25.8 | 17.6 | 25.5 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Point as Skeletonvariant=Video2026.07 | 25.59 | — | — | — | — | — | — | — | — | — | — | 40.93 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| OracleTraining Strategy=Oracle (single source), Detector Framework=BEVDepth2026.03 | 25.5 | — | — | — | — | — | — | — | — | — | — | 33.5 | 38.5 | 50.8 | 20.5 | 24.7 | 17.5 | 24.9 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| OVBEVSegprotocol=Open-Vocabulary2026.06 | 24.1 | — | — | — | — | — | — | — | — | — | — | 30.8 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| MoVieDriveDiverse conditions?=✓, Multi-modal?=✓2025.08 | 22.7 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| BEVDetprotocol=Open-Vocabulary2026.06 | 21.9 | — | — | — | — | — | — | — | — | — | — | 27.1 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| GaussianLSSprotocol=Open-Vocabulary2026.06 | 20.6 | — | — | — | — | — | — | — | — | — | — | 26.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| BEVFormerprotocol=Open-Vocabulary2026.06 | 19.5 | — | — | — | — | — | — | — | — | — | — | 27.5 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| DriveArena2026.07 | 16.06 | — | — | — | — | — | — | — | — | — | — | 30.03 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| CogVideoX + SyntheOccDiverse conditions?=✓, Multi-modal?=✗2025.08 | 15.9 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Point as Skeletonvariant=Image2026.07 | 15.82 | — | — | — | — | — | — | — | — | — | — | 32.87 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Panacea2026.07 | 13.72 | — | — | — | — | — | — | — | — | — | — | 27.73 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| MagicDrive2026.07 | 12.92 | — | — | — | — | — | — | — | — | — | — | 28.36 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| MagicDrive-V2Diverse conditions?=✓, Multi-modal?=✗2025.08 | 11.5 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| MagicDriveDiverse conditions?=✓, Multi-modal?=✗2025.08 | 9.7 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| 3D-VF2025.03 | — | — | — | 30.17 | 18.91 | 10.54 | 7.23 | 0.76 | 0.78 | 13.82 | 8.97 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| CenterFusionInput=Camera+Radar2026.07 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | -9.4 | — | — | — | — | — | — | — | — | |
| CenterPointTraining setup=single-dataset training2024.11 | — | 80 | 80.5 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| CRAFTInput=Camera+Radar2026.07 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | -32.3 | — | — | — | — | — | — | — | — | |
| Cube R-CNN2D bounding boxes=oracle, camera intrinsics=ground truth2026.03 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 30.67 | 41.18 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Cube R-CNN*2D bounding boxes=oracle, camera intrinsics=ground truth2026.03 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 37.58 | 35.69 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| DetAny3D2D bounding boxes=oracle, camera intrinsics=ground truth2026.03 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 24.28 | 43.11 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| FCAF3DTraining setup=single-dataset training2024.11 | — | 46.5 | 45.5 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| GroupFreeTraining setup=single-dataset training2024.11 | — | 10.2 | 8.6 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| ImageBind2026.03 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 6.86 | 1.57 | — | — | — | — | — | — | — | — | — | — | — | |
| Le MuMo JEPA2026.03 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 9.52 | 2.53 | — | — | — | — | — | — | — | — | — | — | — | |
| Li et al.2025.03 | — | — | — | 36.04 | 22.25 | 14.48 | 10.56 | 1.15 | 0.95 | 17.22 | 11.26 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| LM-SCIPInput=Camera+Radar2026.07 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | -40 | — | — | — | — | — | — | — | — | |
| MoCA3D2D bounding boxes=oracle, camera intrinsics=ground truth2026.03 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 30.02 | 39.62 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| MoCA3D-Cube2D bounding boxes=oracle, camera intrinsics=ground truth2026.03 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 39.93 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| MultiMAE-MT2026.03 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 6.67 | 1.62 | — | — | — | — | — | — | — | — | — | — | — | |
| MultiMAE-SS2026.03 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 6.95 | 1.66 | — | — | — | — | — | — | — | — | — | — | — | |
| OneDet3DTraining setup=single-dataset training2024.11 | — | 80.2 | 80.9 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| OneDet3DTraining setup=multi-dataset training2024.11 | — | 81 | 81.8 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| OVMono3D-LIFT*2D bounding boxes=oracle, camera intrinsics=ground truth2026.03 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 34.58 | 37.55 | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| PA-DA2025.03 | — | — | — | 29.43 | 18.06 | 10.84 | 8.43 | 0.82 | 0.43 | 13.7 | 8.97 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| PointPillarTraining setup=single-dataset training2024.11 | — | 73.1 | 74.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| PointRCNNTraining setup=single-dataset training2024.11 | — | 25.5 | 26.7 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| PV-RCNNTraining setup=single-dataset training2024.11 | — | 76 | 76.9 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| SECONDTraining setup=single-dataset training2024.11 | — | 58.4 | 59.2 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| UVTRTraining setup=single-dataset training2024.11 | — | 80.6 | 81.2 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Voxel R-CNN2025.03 | — | — | — | 31.2 | 19.13 | 10.52 | 8.39 | 0.75 | 0.55 | 14.16 | 9.36 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| Voxel R-CNN w/ GBlobsbackbone=Voxel R-CNN2025.03 | — | — | — | 32.08 | 20.08 | 11.6 | 9.13 | 5.67 | 5.1 | 16.45 | 11.44 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | |
| VoxelNeXtTraining setup=single-dataset training2024.11 | — | 80 | 80.6 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — |