Video Multi-modal Understanding on Video-MME
63.3Accuracy (No Subtitles)Qwen2-VL-7B
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| Qwen2-VL-7BModel=Qwen2-VL-7B2026.01 | 63.3 | 69 | |
| VisionTrim on Qwen2-VL-7BModel=Qwen2-VL-7B, Tokens per video frame=approx. 1/3 original2026.01 | 63.1 | 68.9 | |
| VisionTrim on LLaVA-OneVision-7BModel=LLaVA-OneVision-7B, Tokens per video frame=662026.01 | 59.5 | 61.4 | |
| LLaVA-OneVision-7BModel=LLaVA-OneVision-7B, Tokens per video frame=1962026.01 | 58.2 | 61.5 |