Video-based Multimodal Understanding on SEED-Bench video
61.3AccuracyQwen2.5VL
Evaluation Results
| Method | Links | |
|---|---|---|
| Qwen2.5VLSize=7B, Type=AR, Samples=>9M2025.12 | 61.3 | |
| LLaVA-OVSize=7B, Type=AR, Samples=7.8M2025.12 | 56.9 | |
| Qwen2.5VLSize=3B, Type=AR, Samples=>9M2025.12 | 55.1 | |
| DiffusionVLSize=7B, Type=Diff., Samples=738K2025.12 | 54.4 | |
| LLaDA-VSize=8B, Type=Diff., Samples=16.5M2025.12 | 53.7 | |
| DiffusionVLSize=3B, Type=Diff., Samples=738K2025.12 | 52.2 | |
| LLaVA-1.5Size=7B, Type=AR, Samples=-2025.12 | 37.3 | |
| LLaVASize=7B, Type=AR, Samples=-2025.12 | 23.8 |