Captioning on W3D Traffic Accident original (test)
38BLEULLada*
Evaluation Results
| Method | Links | ||||
|---|---|---|---|---|---|
| LLada*Training Regime=Full-data (W3D) [~70k samples]2025.11 | 38 | 32 | 52 | 100 | |
| FSDAMTraining Regime=Few-shot2025.11 | 33 | 35 | 34 | 84 | |
| GazeXplain*Training Regime=Full-data (W3D) [~70k samples]2025.11 | 17 | 20 | 44 | 66 | |
| LLaVATraining Regime=Zero-shot (no training)2025.11 | 17 | 26 | 19 | 13 | |
| DeepGazeI + LLaVATraining Regime=Few-shot2025.11 | 15 | 21 | 31 | 17 | |
| MLNet + LLaVATraining Regime=Few-shot2025.11 | 13 | 18 | 33 | 28 | |
| Qwen-VLTraining Regime=In-context learning (no fine-tuning)2025.11 | 12 | 24 | 33 | 15 | |
| DeepGazeIIE + LLaVATraining Regime=Few-shot2025.11 | 11 | 19 | 34 | 10 | |
| Qwen-VLTraining Regime=Zero-shot (no training)2025.11 | 8 | 21 | 29 | 12 |