Video Multi-modal Understanding on Egoschema
66.7AccuracyQwen2-VL-7B
Evaluation Results
| Method | Links | |
|---|---|---|
| Qwen2-VL-7BModel=Qwen2-VL-7B2026.01 | 66.7 | |
| VisionTrim on Qwen2-VL-7BModel=Qwen2-VL-7B, Tokens per video frame=approx. 1/3 original2026.01 | 66.5 | |
| VisionTrim on LLaVA-OneVision-7BModel=LLaVA-OneVision-7B, Tokens per video frame=662026.01 | 62.3 | |
| LLaVA-OneVision-7BModel=LLaVA-OneVision-7B, Tokens per video frame=1962026.01 | 60.1 |