Captioning on W3D Safety-Critical Situation original (test)
44BLEULLada*
Evaluation Results
| Method | Links | ||||
|---|---|---|---|---|---|
| LLada*Training Regime=Full-data (W3D) [~70k samples]2025.11 | 44 | 38 | 59 | 1.23 | |
| FSDAMTraining Regime=Few-shot2025.11 | 35 | 33 | 46 | 0.47 | |
| MLNet + LLaVATraining Regime=Few-shot2025.11 | 26 | 20 | 32 | 0.12 | |
| Qwen-VLTraining Regime=In-context learning (no fine-tuning)2025.11 | 21 | 17 | 30 | 0.23 | |
| GazeXplain*Training Regime=Full-data (W3D) [~70k samples]2025.11 | 19 | 29 | 37 | 0.55 | |
| Qwen-VLTraining Regime=Zero-shot (no training)2025.11 | 19 | 21 | 29 | 0.13 | |
| LLaVATraining Regime=Zero-shot (no training)2025.11 | 13 | 19 | 11 | 0.1 | |
| DeepGazeI + LLaVATraining Regime=Few-shot2025.11 | 13 | 22 | 30 | 0.18 | |
| DeepGazeIIE + LLaVATraining Regime=Few-shot2025.11 | 11 | 20 | 32 | 0.13 |