Video Understanding on VideoMME Long and Average
63.9Performance (Average)ReTaKe
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| ReTaKeArchitecture=-, Frames=≤ 2048, Base Model=Qwen2-VL-7B2026.04 | 63.9 | 56.2 | |
| Query-Conditioned Evidential Keyframe SamplingArchitecture=CLIP-0.4B, Frames=32, Base Model=Qwen2.5-VL-7B2026.04 | 63.6 | 55 | |
| ASCSArchitecture=CLIP-0.4B, Frames=32, Base Model=Qwen2.5-VL-7B2026.04 | 63.1 | — | |
| AKSArchitecture=CLIP-0.4B, Frames=32, Base Model=Qwen2.5-VL-7B2026.04 | 62.4 | — | |
| K-FramesArchitecture=MLLM-3B, Frames=32, Base Model=Qwen2.5-VL-7B2026.04 | 62.1 | — | |
| BOLTArchitecture=CLIP-0.4B, Frames=32, Base Model=Qwen2.5-VL-7B2026.04 | 62 | — | |
| Qwen2.5-VL-7BArchitecture=-, Frames=32, Base Model=Qwen2.5-VL-7B2026.04 | 60.7 | 50.6 | |
| Query-Conditioned Evidential Keyframe SamplingArchitecture=CLIP-0.4B, Frames=32, Base Model=Qwen2-VL-7B2026.04 | 60.1 | 51.4 | |
| AKSArchitecture=BLIP-0.5B, Frames=32, Base Model=Qwen2-VL-7B2026.04 | 59.9 | — | |
| FOCUSArchitecture=BLIP-0.5B, Frames=32, Base Model=Qwen2-VL-7B2026.04 | 59.7 | — | |
| MLLM-SelectorArchitecture=MLLM-1.5B, Frames=32, Base Model=Qwen2-VL-7B2026.04 | 58.7 | — | |
| Q-FrameArchitecture=CLIP-0.4B, Frames=44, Base Model=Qwen2-VL-7B2026.04 | 58.3 | 48.3 | |
| Qwen2-VL-7BArchitecture=-, Frames=32, Base Model=Qwen2-VL-7B2026.04 | 58 | 48.7 |