End-to-end Planning on nuScenes
0.52L2 Error (3s)DAWN
Evaluation Results
| Method | Links | |||||||||
|---|---|---|---|---|---|---|---|---|---|---|
| DAWN2026.05 | 0.52 | 0.17 | 0.31 | 0.33 | 0 | 0.1 | 0.23 | 0.11 | — | |
| Ego-MLP2025.05 | 0.59 | 0.15 | 0.32 | 0.35 | 0 | 0.0027 | 0.0085 | 0.0037 | — | |
| UniAD2025.05 | 0.75 | 0.2 | 0.42 | 0.46 | 0.0002 | 0.0025 | 0.0084 | 0.0037 | — | |
| WorldRFT2026.05 | 0.76 | 0.21 | 0.44 | 0.47 | 0.1 | 0.11 | 0.23 | 0.15 | — | |
| GenAD2026.05 | 0.78 | 0.28 | 0.49 | 0.52 | 0.08 | 0.14 | 0.34 | 0.19 | — | |
| World4Drive2026.05 | 0.81 | 0.23 | 0.47 | 0.5 | 0 | 0.12 | 0.33 | 0.16 | — | |
| BEV-Planner2026.05 | 0.83 | 0.3 | 0.52 | 0.55 | 0.1 | 0.37 | 1.3 | 0.59 | — | |
| PPAD2026.05 | 0.87 | 0.31 | 0.56 | 0.58 | 0.08 | 0.12 | 0.38 | 0.19 | — | |
| DiffusionDriveInput=Camera, Img. Backbone=ResNet-50 [13], FPS=8.22024.11 | 0.9 | 0.27 | 0.54 | 0.57 | 0.03 | 0.05 | 0.16 | 0.08 | — | |
| SparseDriveInput=Camera, Img. Backbone=ResNet-50 [13], FPS=9.02024.11 | 0.96 | 0.29 | 0.58 | 0.61 | 0.01 | 0.05 | 0.18 | 0.08 | — | |
| LAW2026.05 | 1.01 | 0.26 | 0.57 | 0.61 | 0.14 | 0.21 | 0.54 | 0.3 | — | |
| UniADInput=Camera, Img. Backbone=ResNet-101 [13], FPS=1.82024.11 | 1.04 | 0.45 | 0.7 | 0.73 | 0.62 | 0.58 | 0.63 | 0.61 | — | |
| VADInput=Camera, Img. Backbone=ResNet-50 [13], FPS=4.52024.11 | 1.05 | 0.41 | 0.7 | 0.72 | 0.07 | 0.17 | 0.41 | 0.22 | — | |
| VAD2026.05 | 1.05 | 0.41 | 0.7 | 0.72 | 0.07 | 0.18 | 0.43 | 0.23 | — | |
| GenAD2026.01 | 1.55 | 0.36 | 0.83 | — | — | — | — | 0.43 | — | |
| UniAD2026.01 | 1.65 | 0.48 | 0.96 | — | — | — | — | 0.31 | — | |
| UniAD2026.05 | 1.65 | 0.48 | 0.96 | 1.03 | 0.05 | 0.17 | 0.71 | 0.31 | — | |
| VAD-Base2026.01 | 1.98 | 0.54 | 1.15 | — | — | — | — | 0.53 | — | |
| Eponarole=Baseline2026.01 | 1.98 | 0.61 | 1.17 | — | — | — | — | 0.36 | — | |
| DISKbuilt_on=Epona2026.01 | 2.01 | 0.61 | 1.19 | — | — | — | — | 0.38 | — | |
| MVLAD-ADArchitecture Type=Diffusion Language Modeling2026.02 | 2.34 | 0.7 | 1.31 | 1.28 | — | — | — | — | 0 | |
| ViLaDArchitecture Type=Diffusion VLM2026.02 | 2.69 | 0.81 | 1.93 | 1.81 | — | — | — | — | 0 | |
| ViLaD-OptLearning=Efficient Optimized SFT2024.10 | 2.69 | 0.81 | 1.93 | 1.81 | — | — | — | — | 0 | |
| ViLaD-SFTLearning=SFT2024.10 | 2.83 | 0.79 | 1.92 | 1.85 | — | — | — | — | 0 | |
| ST-P3Input=Camera, Img. Backbone=EffNet-b4 [40], FPS=1.62024.11 | 2.9 | 1.33 | 2.11 | 2.11 | 0.23 | 0.62 | 1.27 | 0.71 | — | |
| ST-P32026.01 | 2.9 | 1.33 | 2.11 | — | — | — | — | 0.71 | — | |
| LightEMMAArchitecture Type=Autoregressive VLM2026.02 | 2.9 | — | — | 1.45 | — | — | — | — | 0 | |
| ST-P32026.05 | 2.9 | 1.33 | 2.11 | 2.11 | 0.23 | 0.62 | 1.27 | 0.71 | — | |
| OccNetInput=Camera, Img. Backbone=ResNet-50 [13], FPS=2.62024.11 | 2.99 | 1.29 | 2.13 | 2.14 | 0.21 | 0.59 | 1.37 | 0.72 | — | |
| OccNet2026.05 | 2.99 | 1.29 | 2.13 | 2.13 | 0.21 | 0.59 | 1.37 | 0.72 | — | |
| Llama-3.2Architecture Type=Autoregressive VLM, Backbone=11B-Vision-Instruct2026.02 | 3.1 | 0.8 | 2.31 | 2.07 | — | — | — | — | 0.0006 | |
| Llama-3.2-11BLearning=SFT2024.10 | 3.1 | 0.8 | 2.31 | 2.07 | — | — | — | — | 0.06 | |
| Qwen2-VL-7BLearning=Zero-Shot2024.10 | 3.21 | 1.22 | 2.94 | 2.46 | — | — | — | — | 24 | |
| LLaVA-1.6Architecture Type=Autoregressive VLM, Backbone=Mistral-7B2026.02 | 3.44 | 0.91 | 2.5 | 2.28 | — | — | — | — | 0.5525 | |
| LLaVA-1.6-7BLearning=SFT2024.10 | 3.44 | 0.91 | 2.5 | 2.28 | — | — | — | — | 55.25 | |
| ViLaD-ZeroLearning=Zero-Shot2024.10 | 3.74 | 1.09 | 2.51 | 2.45 | — | — | — | — | 0.03 | |
| OpenEMMAArchitecture Type=Autoregressive VLM2026.02 | 3.76 | 1.45 | 3.21 | 2.81 | — | — | — | — | 0.1611 | |
| Qwen2-VL-7BLearning=Open-EMMA2024.10 | 3.76 | 1.45 | 3.21 | 2.81 | — | — | — | — | 16.11 | |
| Llama-3.2-11BLearning=Open-EMMA2024.10 | 3.91 | 1.54 | — | 2.92 | — | — | — | — | 22 | |
| Qwen2-VLArchitecture Type=Autoregressive VLM, Backbone=7B-Instruct2026.02 | 3.98 | 1.32 | 2.94 | 2.74 | — | — | — | — | 0.0003 | |
| Qwen2-VL-7BLearning=SFT2024.10 | 3.98 | 1.32 | 2.94 | 2.74 | — | — | — | — | 0.03 | |
| Llama-3.2-11BLearning=Zero-Shot2024.10 | 4.04 | 1.5 | 3.44 | 3 | — | — | — | — | 23.92 | |
| LLaVA-1.6-7BLearning=Open-EMMA2024.10 | 4.09 | 1.49 | 3.38 | 2.98 | — | — | — | — | 6.12 | |
| ViLaD-CoTLearning=Open-EMMA2024.10 | 4.13 | 1.24 | 2.74 | 2.71 | — | — | — | — | 0.17 | |
| LLaVA-1.6-7BLearning=Zero-Shot2024.10 | 4.54 | 1.66 | 3.54 | 3.24 | — | — | — | — | 4.06 | |
| DriveLMArchitecture Type=Autoregressive VLM2026.02 | — | — | — | 1.39 | — | — | — | — | — | |
| UniAD-SingleFrame Configuration=single-frame2026.02 | — | — | — | 1.8 | — | — | — | — | — |