Video Captioning on Video Detail Description (VDD)
39.32Token/sLVSPEC
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| LVSPECModel=Qwen2.5-VL, Setting=Self-SD2026.04 | 39.32 | 8.64 | 1.59 | |
| SPECVLMModel=Qwen2.5-VL, Setting=Self-SD2026.04 | 35 | 3.89 | 1.41 | |
| LVSPECModel=LLaVA-OV, Setting=Self-SD2026.04 | 34.96 | 8.87 | 1.98 | |
| FLY⊖Model=Qwen2.5-VL, Setting=Self-SD2026.04 | 33.58 | 7.17 | 1.36 | |
| FLYModel=Qwen2.5-VL, Setting=Self-SD2026.04 | 30.3 | 6.35 | 1.22 | |
| SPECVLMModel=LLaVA-OV, Setting=Self-SD2026.04 | 29.08 | 3.95 | 1.65 | |
| FLY⊖Model=LLaVA-OV, Setting=Self-SD2026.04 | 27.01 | 6.82 | 1.45 | |
| FLYModel=LLaVA-OV, Setting=Self-SD2026.04 | 25.57 | 6.2 | 1.45 | |
| AutoregressiveModel=Qwen2.5-VL, Setting=Self-SD2026.04 | 24.75 | — | 1 | |
| LVSPECModel=Qwen2.5-VL, Setting=Std.-SD2026.04 | 23.58 | 7.68 | 2.34 | |
| NAIVE SDModel=Qwen2.5-VL, Setting=Self-SD2026.04 | 23.22 | 4.46 | 0.94 | |
| FLY⊖Model=Qwen2.5-VL, Setting=Std.-SD2026.04 | 22.14 | 7.2 | 2.2 | |
| SPECVLMModel=Qwen2.5-VL, Setting=Std.-SD2026.04 | 17.96 | 3.31 | 1.76 | |
| AutoregressiveModel=LLaVA-OV, Setting=Self-SD2026.04 | 17.66 | — | 1 | |
| LVSPECModel=LLaVA-OV, Setting=Std.-SD2026.04 | 17.45 | 7.59 | 2.91 | |
| NAIVE SDModel=LLaVA-OV, Setting=Self-SD2026.04 | 15.74 | 4.59 | 0.89 | |
| SPECVLMModel=LLaVA-OV, Setting=Std.-SD2026.04 | 14.94 | 3.53 | 2.49 | |
| FLYModel=Qwen2.5-VL, Setting=Std.-SD2026.04 | 14.51 | 4.34 | 1.44 | |
| NAIVE SDModel=Qwen2.5-VL, Setting=Std.-SD2026.04 | 14.44 | 3.36 | 1.42 | |
| FLY⊖Model=LLaVA-OV, Setting=Std.-SD2026.04 | 11.9 | 4.93 | 1.98 | |
| NAIVE SDModel=LLaVA-OV, Setting=Std.-SD2026.04 | 11.74 | 3.72 | 1.96 | |
| FLYModel=LLaVA-OV, Setting=Std.-SD2026.04 | 11.5 | 4.58 | 1.92 | |
| AutoregressiveModel=Qwen2.5-VL, Setting=Std.-SD2026.04 | 10.07 | — | 1 | |
| AutoregressiveModel=LLaVA-OV, Setting=Std.-SD2026.04 | 6 | — | 1 |