3D Object Detection on nuScenes (val)
78.2NDSX-Ray Teacher* Transfusion-L
Evaluation Results
| Method | Links | |||||||||||||||||||||||||||||||||
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| X-Ray Teacher* Transfusion-LBackbone=Transfusion-L, Mode=Teacher2024.03 | 78.2 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 81.3 | — | — | — | — | — | — | — | |
| MambaFusionModality=C+L, Image Backbone=Swin-T, LiDAR Backbone=Hybrid SSM-Attn, CBGS training strategy=false2026.02 | 77.9 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 74.9 | — | — | — | — | — | — | — | |
| SparseLIFModality=C+L, Image Backbone=V2-99, LiDAR Backbone=VoxelNet, CBGS training strategy=false2026.02 | 77.5 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 74.7 | — | — | — | — | — | — | — | |
| X-Ray Teacher* CenterPoint-VoxelBackbone=CenterPoint-Voxel, Mode=Teacher2024.03 | 77.1 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 79.5 | — | — | — | — | — | — | — | |
| MV2DFusionModality=C+L, Image Backbone=ConvNeXt-L, LiDAR Backbone=VoxelNet, CBGS training strategy=false2026.02 | 75.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 73.9 | — | — | — | — | — | — | — | |
| DeepInteraction-eModality=L+C, Image Backbone=Swin-Tiny, LiDAR Backbone=VoxelNet, Test-time augmentation=true, Model ensemble=true2022.08 | 75 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 73.9 | — | — | — | — | — | — | — | |
| BEVFusion-e [30]Modality=L+C, Image Backbone=Swin-Tiny, LiDAR Backbone=VoxelNet, Test-time augmentation=true, Model ensemble=true2022.08 | 74.9 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 73.7 | — | — | — | — | — | — | — | |
| SparseLIF-SModality=C+L, Image Backbone=V2-99, LiDAR Backbone=VoxelNet, CBGS training strategy=false2026.02 | 74.6 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 71.2 | — | — | — | — | — | — | — | |
| DeepInteraction-largeModality=L+C, Image Backbone=Swin-Tiny, LiDAR Backbone=VoxelNet, Test-time augmentation=true, Model ensemble=false2022.08 | 74.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 72.6 | — | — | — | — | — | — | — | |
| FusionFormerModality=C+L, Image Backbone=V2-99, LiDAR Backbone=VoxelNet, CBGS training strategy=true2026.02 | 74.1 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 71.4 | — | — | — | — | — | — | — | |
| IS-FUSIONImage Encoder=Swin-T, FPS=3.22024.03 | 74 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 72.8 | — | — | — | — | — | — | — | |
| MEFormerModality=L+C2024.07 | 73.9 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 71.5 | — | — | — | — | — | — | — | |
| GAFusionModality=LC2024.11 | 73.5 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 72.1 | — | — | — | — | — | — | — | |
| BEVFusion4DModality=C+L, Image Backbone=Swin-T, LiDAR Backbone=VoxelNet, CBGS training strategy=false2026.02 | 73.5 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 72 | — | — | — | — | — | — | — | |
| UniTR w/ LSSModality=Camera + LiDAR, Latency=107.5 ms, Latency (TensorRT)=69.1 ms2023.08 | 73.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 70.5 | — | — | — | — | — | — | — | |
| UniTRModality=L+C2024.07 | 73.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 70.5 | — | — | — | — | — | — | — | |
| CMT-Large + ALIGNQuery Init.=ALIGN, Test-time augmentation=false2025.12 | 73.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 71.1 | — | — | — | — | — | — | — | |
| UVTR-M + UniPADModality=Multi-modality, CBGS=true2023.10 | 73.2 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 69.9 | — | — | — | — | — | — | — | |
| UVTR-M + PonderV2Modality=Camera+LiDAR2023.10 | 73.2 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 69.9 | — | — | — | — | — | — | — | |
| FusionFormer-SModality=C+L, Image Backbone=V2-99, LiDAR Backbone=VoxelNet, CBGS training strategy=true2026.02 | 73.2 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 70 | — | — | — | — | — | — | — | |
| UniTRModality=Camera + LiDAR, Latency=88.7 ms, Latency (TensorRT)=50.2 ms2023.08 | 73.1 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 70 | — | — | — | — | — | — | — | |
| SparseFusionImage Encoder=Swin-T, FPS=5.32024.03 | 73.1 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 71 | — | — | — | — | — | — | — | |
| SparseFusionModality=C+L, Image Backbone=Swin-T, LiDAR Backbone=VoxelNet, CBGS training strategy=false2026.02 | 73.1 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 71 | — | — | — | — | — | — | — | |
| EA-LSSModality=C+L, Image Backbone=Swin-T, LiDAR Backbone=VoxelNet, CBGS training strategy=false2026.02 | 73.1 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 71.2 | — | — | — | — | — | — | — | |
| FocalFormer3DQuery Init.=Heatmap, Test-time augmentation=false2025.12 | 73.1 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 70.5 | — | — | — | — | — | — | — | |
| SparseFusion + ALIGNQuery Init.=ALIGN, Test-time augmentation=false2025.12 | 73.1 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 70.9 | — | — | — | — | — | — | — | |
| CMTImage Encoder=VoV-99, FPS=3.82024.03 | 72.9 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 70.3 | — | — | — | — | — | — | — | |
| CMT-MModality=Multi-modality, CBGS=true2023.10 | 72.9 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 70.3 | — | — | — | — | — | — | — | |
| CMTModality=L+C2024.07 | 72.9 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 70.3 | — | — | — | — | — | — | — | |
| CMT-MPresented at=ICCV'23, Modality=Camera+LiDAR, CBGS=true2023.10 | 72.9 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 70.3 | — | — | — | — | — | — | — | |
| BEVFusion4D-SModality=C+L, Image Backbone=Swin-T, LiDAR Backbone=VoxelNet, CBGS training strategy=false2026.02 | 72.9 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 70.9 | — | — | — | — | — | — | — | |
| CMTModality=C+L, Image Backbone=V2-99, LiDAR Backbone=VoxelNet, CBGS training strategy=false2026.02 | 72.9 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 70.3 | — | — | — | — | — | — | — | |
| CMTLiDAR Time Offset=0s, Backbone=CMT2026.01 | 72.9 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 70.3 | — | — | 6.7 | — | — | — | — | |
| CMT-LargeQuery Init.=Random, Test-time augmentation=false2025.12 | 72.9 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 70.3 | — | — | — | — | — | — | — | |
| SparseFusionModality=Multi-modality, CBGS=true2023.10 | 72.8 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 70.4 | — | — | — | — | — | — | — | |
| SparseFusionModality=L+C2024.07 | 72.8 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 70.4 | — | — | — | — | — | — | — | |
| SparseFusionModality=LC2024.11 | 72.8 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 70.5 | — | — | — | — | — | — | — | |
| SparseFusionQuery Init.=Heatmap, Test-time augmentation=false2025.12 | 72.8 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 70.5 | — | — | — | — | — | — | — | |
| UniMamba2025.03 | 72.6 | — | — | — | — | 68.5 | — | — | — | — | — | 88.7 | 64.7 | 79.7 | 47.9 | 28.7 | 89.7 | 74.6 | 59.1 | 79.5 | 72.3 | — | — | — | — | — | — | — | — | — | — | — | — | |
| DeepInteraction-baseModality=L+C, Image Backbone=R50, LiDAR Backbone=VoxelNet, Test-time augmentation=false, Model ensemble=false2022.08 | 72.6 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 69.9 | — | — | — | — | — | — | — | |
| DeepInteractionModality=Camera + LiDAR, Latency=541.1 ms2023.08 | 72.6 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 69.9 | — | — | — | — | — | — | — | |
| DeepInteractionImage Encoder=Swin-T, FPS=2.62024.03 | 72.6 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 69.9 | — | — | — | — | — | — | — | |
| DeepInteractionModality=Multi-modality, CBGS=true2023.10 | 72.6 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 69.9 | — | — | — | — | — | — | — | |
| DeepInteractionModality=L+C2024.07 | 72.6 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 69.9 | — | — | — | — | — | — | — | |
| DeepInteractionModality=LC2024.11 | 72.6 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 69.9 | — | — | — | — | — | — | — | |
| DeepInteractionPresented at=NeurIPS'22, Modality=Camera+LiDAR, CBGS=true2023.10 | 72.6 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 69.9 | — | — | — | — | — | — | — | |
| DeepInteractionModality=C+L, Image Backbone=ResNet-50, LiDAR Backbone=VoxelNet, CBGS training strategy=false2026.02 | 72.6 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 69.9 | — | — | — | — | — | — | — | |
| EfficientQ3MQuery Init.=Heatmap, Test-time augmentation=false2025.12 | 72.6 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 70.5 | — | — | — | — | — | — | — | |
| Multi-Modal Decouple and Recouple Network2026.03 | 72.5 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 69.8 | — | — | — | — | — | — | — | |
| X-Ray Teacher* CBGSBackbone=CBGS, Mode=Teacher2024.03 | 72.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 77.1 | — | — | — | — | — | — | — | |
| CMF-IoU2026.03 | 72.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 69.1 | — | — | — | — | — | — | — | |
| ObjectFusionModality=Multi-modality, CBGS=true2023.10 | 72.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 69.8 | — | — | — | — | — | — | — | |
| SyNet2026.03 | 72.2 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 69.4 | — | — | — | — | — | — | — | |
| LION-MambaPresent at=NIPS'20242025.03 | 72.1 | — | — | — | — | 68 | — | — | — | — | — | 87.9 | 64.9 | 77.6 | 44.4 | 28.5 | 89.6 | 75.6 | 59.4 | 80.8 | 71.6 | — | — | — | — | — | — | — | — | — | — | — | — | |
| BEVFusionModality=LC, BEV-space data augmentation=true2022.05 | 72.1 | — | — | — | — | — | — | — | — | — | — | 89.1 | 66.7 | 77.7 | 42.6 | 30.9 | 89.4 | 79 | — | 79.3 | 73.5 | — | — | — | — | 69.6 | 67.5 | — | — | — | — | — | — | |
| LION-MambaPresent at=-2024.07 | 72.1 | — | — | — | — | 68 | — | — | — | — | — | 87.9 | 64.9 | 77.6 | 44.4 | 28.5 | 89.6 | 75.6 | — | 80.8 | 71.6 | — | — | — | — | — | 59.4 | — | — | — | — | — | — | |
| LION-Mamba2024.07 | 72.1 | — | — | — | — | — | — | — | — | — | — | 87.9 | 64.9 | 77.6 | 44.4 | 28.5 | 89.6 | 75.6 | — | 80.8 | 71.6 | — | — | — | — | 68 | 59.4 | — | — | — | — | — | — | |
| BEVFusionModality=L+C, Citation=[13]2024.07 | 72.1 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 69.6 | — | — | — | — | — | — | — | |
| MSMDFusionModality=LC2024.11 | 72.1 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 69.3 | — | — | — | — | — | — | — | |
| BEVFusionModality=C+L, Image Backbone=Swin-T, LiDAR Backbone=VoxelNet, CBGS training strategy=false, config_version=v22026.02 | 72.1 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 69.6 | — | — | — | — | — | — | — | |
| Fusion4CAModality=L+C2026.03 | 72.1 | — | — | — | — | 69.7 | — | — | — | — | — | 89.7 | 66.2 | 77.3 | — | 31.9 | 89.5 | — | 66.3 | 80.3 | — | — | — | — | — | — | — | — | — | 43.6 | 72.3 | 79.5 | — | |
| LION-RetNetPresent at=-2024.07 | 71.9 | — | — | — | — | 67.3 | — | — | — | — | — | 87.9 | 64.3 | 78.7 | 44.6 | 27.6 | 88.9 | 73.5 | — | 79.2 | 72.1 | — | — | — | — | — | 56.6 | — | — | — | — | — | — | |
| LION-RetNet2024.07 | 71.9 | — | — | — | — | — | — | — | — | — | — | 87.9 | 64.3 | 78.7 | 44.6 | 27.6 | 88.9 | 73.5 | — | 79.2 | 72.1 | — | — | — | — | 67.3 | 56.6 | — | — | — | — | — | — | |
| DGFusion2026.03 | 71.9 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 69.2 | — | — | — | — | — | — | — | |
| FUTR3D + ALIGNQuery Init.=ALIGN, Test-time augmentation=false2025.12 | 71.8 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 68.2 | — | — | — | — | — | — | — | |
| TransFusionModality=LC2022.05 | 71.7 | — | — | — | — | — | — | — | — | — | — | 87.1 | 60 | 68.3 | 60.8 | 33.1 | 88.4 | 73.6 | — | 86.7 | 78.1 | — | — | — | — | 68.9 | 52.9 | — | — | — | — | — | — | |
| LION-RWKVPresent at=-2024.07 | 71.7 | — | — | — | — | 66.8 | — | — | — | — | — | 88.1 | 59 | 77.6 | 46.6 | 28 | 89.7 | 74.3 | — | 80.1 | 68.3 | — | — | — | — | — | 56.2 | — | — | — | — | — | — | |
| LION-RWKV2024.07 | 71.7 | — | — | — | — | — | — | — | — | — | — | 88.1 | 59 | 77.6 | 46.6 | 28 | 89.7 | 74.3 | — | 80.1 | 68.3 | — | — | — | — | 66.8 | 56.2 | — | — | — | — | — | — | |
| FusionPaintingModality=LC2022.05 | 71.6 | — | — | — | — | — | — | — | — | — | — | 87.1 | 60.8 | 68.5 | 61.7 | 30 | 88.3 | 74.7 | — | 85 | 71.8 | — | — | — | — | 68.1 | 53.5 | — | — | — | — | — | — | |
| Focals Conv-FModality=L+C, Image Backbone=R50, LiDAR Backbone=VoxelNet-FocalsConv, Test-time augmentation=true, Model ensemble=false2022.08 | 71.5 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 67.1 | — | — | — | — | — | — | — | |
| MetaBEVModality=L+C2024.07 | 71.5 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 68 | — | — | — | — | — | — | — | |
| CMT+AsyncBEVLiDAR Time Offset=0.25s, Finetuned=true2026.01 | 71.5 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 68.3 | — | — | 6.3 | — | — | — | — | |
| BEVFusion [30]Modality=L+C, Image Backbone=Swin-Tiny, LiDAR Backbone=VoxelNet, Test-time augmentation=false, Model ensemble=false2022.08 | 71.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 68.5 | — | — | — | — | — | — | — | |
| BEVFusion (MIT)Modality=Camera + LiDAR, Latency=130.5 ms2023.08 | 71.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 68.5 | — | — | — | — | — | — | — | |
| BEVFusionImage Encoder=Swin-T, FPS=4.22024.03 | 71.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 68.5 | — | — | — | — | — | — | — | |
| BEVFusionModality=Multi-modality, CBGS=true, Source=[54]2023.10 | 71.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 68.5 | — | — | — | — | — | — | — | |
| HEDNetPresent at=NeurIPS 232024.07 | 71.4 | — | — | — | — | 66.7 | — | — | — | — | — | 87.7 | 60.6 | 77.8 | 50.7 | 28.9 | 87.1 | 74.3 | — | 76.3 | 66.9 | — | — | — | — | — | 56.8 | — | — | — | — | — | — | |
| HEDNet2024.07 | 71.4 | — | — | — | — | — | — | — | — | — | — | 87.7 | 60.6 | 77.8 | 50.7 | 28.9 | 87.1 | 74.3 | — | 76.3 | 66.9 | — | — | — | — | 66.7 | 56.8 | — | — | — | — | — | — | |
| BEVFusionModality=L+C, Citation=[16]2024.07 | 71.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 68.5 | — | — | — | — | — | — | — | |
| BEVFusionModality=C+L, MACs (G)=253.2, Latency (ms)=119.22022.05 | 71.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 68.5 | — | — | — | — | — | — | — | |
| BEVFusionModality=LC2024.11 | 71.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 68.5 | — | — | — | — | — | — | — | |
| BEVFusion (ICRA'23)Presented at=ICRA'23, Modality=Camera+LiDAR, CBGS=true2023.10 | 71.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 68.5 | — | — | — | — | — | — | — | |
| BEVFusionModality=C+L, Image Backbone=Swin-T, LiDAR Backbone=VoxelNet, CBGS training strategy=false, config_version=v12026.02 | 71.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 68.5 | — | — | — | — | — | — | — | |
| CMT+AsyncBEV (FD)LiDAR Time Offset=0.25s, Frozen Detection Heads=true2026.01 | 71.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 68.1 | — | — | 6.3 | — | — | — | — | |
| CMT-small + ALIGNQuery Init.=ALIGN, Test-time augmentation=false2025.12 | 71.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 68.3 | — | — | — | — | — | — | — | |
| BEVFusionModality=L+C2026.03 | 71.4 | — | — | — | — | 68.5 | — | — | — | — | — | 89.2 | 64.6 | 75.4 | — | 30.4 | 88.2 | — | 65.3 | 79.5 | — | — | — | — | — | — | — | — | — | 42.5 | 72 | 78.5 | — | |
| BEVFusion2026.03 | 71.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 68.5 | — | — | — | — | — | — | — | |
| RobBEV2026.03 | 71.4 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 68.7 | — | — | — | — | — | — | — | |
| TransFusionModality=L+C, Image Backbone=R50, LiDAR Backbone=VoxelNet, Test-time augmentation=false, Model ensemble=false2022.08 | 71.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 67.5 | — | — | — | — | — | — | — | |
| TransFusionModality=Camera + LiDAR, Latency=164.6 ms2023.08 | 71.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 67.5 | — | — | — | — | — | — | — | |
| TransFusion-LCImage Encoder=ResNet-50, FPS=3.22024.03 | 71.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 67.5 | — | — | — | — | — | — | — | |
| TransFusionModality=Multi-modality, CBGS=true2023.10 | 71.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 67.5 | — | — | — | — | — | — | — | |
| TransFusionModality=L+C2024.07 | 71.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 67.5 | — | — | — | — | — | — | — | |
| TransFusionModality=C+L, MACs (G)=485.8, Latency (ms)=156.62022.05 | 71.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 67.5 | — | — | — | — | — | — | — | |
| TransFusionModality=LC2024.11 | 71.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 67.5 | — | — | — | — | — | — | — | |
| TransFusionPresented at=CVPR'22, Modality=Camera+LiDAR, CBGS=true2023.10 | 71.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 67.5 | — | — | — | — | — | — | — | |
| TransFusionModality=C+L, Image Backbone=ResNet-50, LiDAR Backbone=VoxelNet, CBGS training strategy=false2026.02 | 71.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 67.5 | — | — | — | — | — | — | — | |
| Transfusion + ALIGNQuery Init.=ALIGN, Test-time augmentation=false2025.12 | 71.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 67.7 | — | — | — | — | — | — | — | |
| MetaBEV2026.03 | 71.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 68.6 | — | — | — | — | — | — | — | |
| RoboFusion2026.03 | 71.3 | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | — | 69.1 | — | — | — | — | — | — | — |