Planning on NAVSIM (navtest)
99.6NCDiffusionDrive
Evaluation Results
| Method | Links | ||||||
|---|---|---|---|---|---|---|---|
| DiffusionDriveInput=Camera & LiDAR, Img Backbone=ResNet-342025.04 | 99.6 | 96.5 | 98.5 | 100 | 85.3 | 84.9 | |
| FUMPInput=Camera & LiDAR, Img Backbone=ResNet-342025.04 | 99.6 | 96.6 | 98.2 | 100 | 83.7 | 83.4 | |
| Transfuser*Input=Camera & LiDAR, Img Backbone=ResNet-342025.04 | 99.2 | 95.3 | 97.7 | 100 | 78.8 | 78 | |
| DrivingGPTImage=true, Lidar=false, Fine-tuned=true2025.06 | 98.9 | 90.7 | 94.9 | 95.6 | 79.7 | 82.4 | |
| DrivingGPTDecoder=Regression2026.01 | 98.9 | 90.7 | 94.9 | 95.6 | 79.7 | 82.4 | |
| LatentVLADecoder=Scoring, Backbone=iPad2026.01 | 98.9 | 98.2 | 95.2 | 100 | 88.2 | 92.4 | |
| Distilled LatentVLADecoder=Scoring, Backbone=iPad2026.01 | 98.8 | 98.3 | 95 | 99.9 | 88.1 | 92.1 | |
| D3-MoE (Best-of-Three)Input=C2026.06 | 98.7 | 97.7 | 95.3 | 100 | 87.6 | 91.3 | |
| GraphBEV++ (Query)Input=LC2026.06 | 98.7 | 97.1 | 82 | 95.1 | 99.9 | 88.7 | |
| iPadDecoder=Scoring2026.01 | 98.6 | 98.3 | 94.9 | 100 | 88 | 91.7 | |
| WoTEImage=true, Lidar=true, Fine-tuned=false2025.06 | 98.5 | 96.8 | 94.9 | 99.9 | 81.9 | 88.3 | |
| WoTEDecoder=Scoring2026.01 | 98.5 | 96.8 | 94.9 | 99.9 | 81.9 | 88.3 | |
| WoTEInput=LC2026.06 | 98.5 | 96.8 | 81.9 | 94.9 | 99.9 | 88.3 | |
| Hydra-MDPInput=Camera & LiDAR, Img Backbone=ResNet-342025.04 | 98.3 | 96 | 94.6 | 100 | 78.7 | 86.5 | |
| Hydra-MDP-V8192-W-EPImage=true, Lidar=true, Fine-tuned=false2025.06 | 98.3 | 96 | 94.6 | 100 | 78.7 | 86.5 | |
| Hydra-MDP-V8192-W-EPInput=C & L, Img. Backbone=ResNet-34, Anchor=81922024.11 | 98.3 | 96 | 94.6 | 100 | 78.7 | 86.5 | |
| Hydra-MDP-V8192-W-EPDecoder=Scoring2026.01 | 98.3 | 96 | 94.6 | 100 | 78.7 | 86.5 | |
| ARTEMISInput=C&L2026.06 | 98.3 | 95.1 | 94.2 | 100 | 81.4 | 86.9 | |
| D3-MoE (Normal)Input=C2026.06 | 98.3 | 96.4 | 94.3 | 99.9 | 82.7 | 88.2 | |
| Hydra-MDPInput=LC2026.06 | 98.3 | 96 | 94.6 | 100 | 78.7 | 86.5 | |
| DiffusionDriveInput=Camera & LiDAR, Img Backbone=ResNet-342025.04 | 98.2 | 96.2 | 94.7 | 100 | 82.2 | 88.1 | |
| DiffusionDriveImage=true, Lidar=true, Fine-tuned=false2025.06 | 98.2 | 96.2 | 94.7 | 100 | 82.2 | 88.1 | |
| DiffusionDriveInput=C & L, Img. Backbone=ResNet-34, Anchor=202024.11 | 98.2 | 96.2 | 94.7 | 100 | 82.2 | 88.1 | |
| DiffusionDriveDecoder=Diffusion+Scoring2026.01 | 98.2 | 96.2 | 94.7 | 100 | 82.2 | 88.1 | |
| LatentVLADecoder=Regression, Backbone=Transfuser2026.01 | 98.2 | 95.9 | 94.8 | 99.9 | 79.4 | 86.6 | |
| FSDriveInput=C2026.06 | 98.2 | 93.8 | 93.3 | 99.9 | 80.1 | 85.1 | |
| DiffusionDriveInput=C&L2026.06 | 98.2 | 96.2 | 94.7 | 100 | 82.2 | 88.1 | |
| DiffusionDriveInput=LC2026.06 | 98.2 | 96.2 | 94.7 | 100 | 82.2 | 88.1 | |
| FUMPInput=Camera & LiDAR, Img Backbone=ResNet-342025.04 | 98.1 | 96.2 | 94.2 | 100 | 82 | 87.8 | |
| DistillDriveInput=C&L2026.06 | 98.1 | 94.6 | 93.6 | 100 | 81 | 86.2 | |
| PRIXInput=C2026.06 | 98.1 | 96.3 | 94.1 | 100 | 82.3 | 87.8 | |
| DRAMAInput=Camera & LiDAR, Img Backbone=ResNet-342025.04 | 98 | 93.1 | 94.8 | 100 | 80.1 | 85.5 | |
| DRAMAImage=true, Lidar=false, Fine-tuned=false2025.06 | 98 | 93.1 | 94.8 | 100 | 80.1 | 85.5 | |
| DRAMAInput=C & L, Img. Backbone=ResNet-34, Anchor=02024.11 | 98 | 93.1 | 94.8 | 100 | 80.1 | 85.5 | |
| DRAMADecoder=Regression2026.01 | 98 | 93.1 | 94.8 | 100 | 80.1 | 85.5 | |
| Distilled LatentVLADecoder=Regression, Backbone=Transfuser2026.01 | 98 | 95.4 | 94.7 | 100 | 79.3 | 85.7 | |
| D3-MoE (Conservative)Input=C2026.06 | 98 | 94.7 | 93.1 | 100 | 79.6 | 85.5 | |
| PARA-DriveInput=Camera, Img Backbone=ResNet-342025.04 | 97.9 | 92.4 | 93 | 99.8 | 79.3 | 84 | |
| PARA-DriveImage=true, Lidar=false, Fine-tuned=false2025.06 | 97.9 | 92.4 | 93 | 99.8 | 79.3 | 84 | |
| ReCogDriveImage=true, Lidar=false, Fine-tuned=false2025.06 | 97.9 | 97.3 | 94.9 | 100 | 87.3 | 90.8 | |
| PARA-DriveInput=Camera, Img. Backbone=ResNet-34, Anchor=02024.11 | 97.9 | 92.4 | 93 | 99.8 | 79.3 | 84 | |
| Hydra-MDP-V8192Input=C & L, Img. Backbone=ResNet-34, Anchor=81922024.11 | 97.9 | 91.7 | 92.9 | 100 | 77.6 | 83 | |
| PARA-DriveDecoder=Regression2026.01 | 97.9 | 92.4 | 93 | 99.8 | 79.3 | 84 | |
| ReCogDriveDecoder=Diffusion+Scoring2026.01 | 97.9 | 97.3 | 94.9 | 100 | 87.3 | 90.8 | |
| PARA-DriveInput=C2026.06 | 97.9 | 92.4 | 93 | 99.8 | 79.3 | 84 | |
| EponaInput=C2026.06 | 97.9 | 95.1 | 93.8 | 99.9 | 80.4 | 86.2 | |
| PARA-DriveInput=C2026.06 | 97.9 | 92.4 | 93 | 99.8 | 79.3 | 84 | |
| UniADInput=Camera, Img Backbone=ResNet-342025.04 | 97.8 | 91.9 | 92.9 | 100 | 78.8 | 83.4 | |
| UniADImage=true, Lidar=false, Fine-tuned=false2025.06 | 97.8 | 91.9 | 92.9 | 100 | 78.8 | 83.4 | |
| QwenVL2.5-8BImage=true, Lidar=false, Fine-tuned=true2025.06 | 97.8 | 92.1 | 92.8 | 100 | 78.3 | 83.3 | |
| UniADInput=Camera, Img. Backbone=ResNet-34, Anchor=02024.11 | 97.8 | 91.9 | 92.9 | 100 | 78.8 | 83.4 | |
| UniADDecoder=Regression2026.01 | 97.8 | 91.9 | 92.9 | 100 | 78.8 | 83.4 | |
| UniADInput=C2026.06 | 97.8 | 91.9 | 92.9 | 100 | 78.8 | 83.4 | |
| UniADInput=C2026.06 | 97.8 | 91.9 | 92.9 | 100 | 78.8 | 83.4 | |
| TransfuserInput=Camera & LiDAR, Img Backbone=ResNet-342025.04 | 97.7 | 92.8 | 92.8 | 100 | 79.2 | 84 | |
| TransFuserImage=true, Lidar=true, Fine-tuned=false2025.06 | 97.7 | 92.8 | 92.8 | 100 | 79.2 | 84 | |
| TransfuserInput=C & L, Img. Backbone=ResNet-34, Anchor=02024.11 | 97.7 | 92.8 | 92.8 | 100 | 79.2 | 84 | |
| TransFuserDecoder=Regression2026.01 | 97.7 | 92.8 | 92.8 | 100 | 79.2 | 84 | |
| TransfuserInput=C&L2026.06 | 97.7 | 92.8 | 92.8 | 100 | 79.2 | 84 | |
| NoRDInput=C&L2026.06 | 97.6 | 94.9 | 93.5 | 100 | 79.3 | 85.6 | |
| DriveXInput=C2026.06 | 97.5 | 94 | 93 | 100 | 79.7 | 84.5 | |
| LTFInput=Camera, Img Backbone=ResNet-342025.04 | 97.4 | 92.8 | 92.4 | 100 | 79 | 83.8 | |
| LTFInput=Camera, Img. Backbone=ResNet-34, Anchor=02024.11 | 97.4 | 92.8 | 92.4 | 100 | 79 | 83.8 | |
| LTFInput=C2026.06 | 97.4 | 92.8 | 92.4 | 100 | 79 | 83.8 | |
| VADv2Input=Camera & LiDAR, Img Backbone=ResNet-342025.04 | 97.2 | 89.1 | 91.6 | 100 | 76 | 80.9 | |
| VADV2-V8192Image=true, Lidar=false, Fine-tuned=false2025.06 | 97.2 | 89.1 | 91.6 | 100 | 76 | 80.9 | |
| VADV2-V8192Input=C & L, Img. Backbone=ResNet-34, Anchor=81922024.11 | 97.2 | 89.1 | 91.6 | 100 | 76 | 80.9 | |
| VADv2-V8192Decoder=Scoring2026.01 | 97.2 | 89.1 | 91.6 | 100 | 76 | 80.9 | |
| VADv2Input=C&L2026.06 | 97.2 | 89.1 | 91.6 | 100 | 76 | 80.9 | |
| VADv2Input=LC2026.06 | 97.2 | 89.1 | 91.6 | 100 | 76 | 80.9 | |
| InternVL3-8BImage=true, Lidar=false, Fine-tuned=true2025.06 | 97 | 92.4 | 91.8 | 100 | 78.9 | 83.3 | |
| LAWInput=C2026.06 | 96.4 | 95.4 | 88.7 | 99.9 | 81.7 | 84.6 | |
| Transfuser*Input=Camera & LiDAR, Img Backbone=ResNet-342025.04 | 96.2 | 95.4 | 90.7 | 100 | 80.7 | 85.1 | |
| D3-MoE (Aggressive)Input=C2026.06 | 96.1 | 91.2 | 87.1 | 99.9 | 79.5 | 80.9 | |
| Ego Status MLPImage=false, Lidar=false, Fine-tuned=false2025.06 | 93 | 77.3 | 83.6 | 100 | 62.8 | 65.6 | |
| Ego Status MLPDecoder=-2026.01 | 93 | 77.3 | 83.6 | 100 | 62.8 | 65.6 | |
| Constant VelocityImage=false, Lidar=false, Fine-tuned=false2025.06 | 68 | 57.8 | 50 | 100 | 19.4 | 20.6 | |
| Constant VelocityDecoder=-2026.01 | 68 | 57.8 | 50 | 100 | 19.4 | 20.6 |