Open-ended Video Question Answering on NExT-QA (val)
26.8WUPSInternVL3 + ReFoCUS
Evaluation Results
| Method | Links | |
|---|---|---|
| InternVL3 + ReFoCUSLLM Size=8B, Sampling Strategy=ReFoCUS, Frame Budget=32-frame2025.06 | 26.8 | |
| InternVL3LLM Size=8B, Sampling Strategy=Uniform sampling, Frame Budget=32-frame2025.06 | 26.6 | |
| VideoLLaMA 3 + ReFoCUSLLM Size=7B, Sampling Strategy=ReFoCUS, Frame Budget=32-frame2025.06 | 26.5 | |
| VideoLLaMA 3LLM Size=7B, Sampling Strategy=Uniform sampling, Frame Budget=32-frame2025.06 | 25.8 | |
| Qwen3-VL + ReFoCUSLLM Size=8B, Sampling Strategy=ReFoCUS, Frame Budget=32-frame2025.06 | 25.7 | |
| Qwen3-VLLLM Size=8B, Sampling Strategy=Uniform sampling, Frame Budget=32-frame2025.06 | 25.3 | |
| InternVL3 + ReFoCUSLLM Size=2B, Sampling Strategy=ReFoCUS, Frame Budget=32-frame2025.06 | 25 | |
| InternVL3.5 + ReFoCUSLLM Size=8B, Sampling Strategy=ReFoCUS, Frame Budget=32-frame2025.06 | 24.7 | |
| InternVL3LLM Size=2B, Sampling Strategy=Uniform sampling, Frame Budget=32-frame2025.06 | 24.4 | |
| InternVL3.5LLM Size=8B, Sampling Strategy=Uniform sampling, Frame Budget=32-frame2025.06 | 24.3 | |
| Qwen3-VL + ReFoCUSLLM Size=4B, Sampling Strategy=ReFoCUS, Frame Budget=32-frame2025.06 | 24.1 | |
| Qwen3-VLLLM Size=4B, Sampling Strategy=Uniform sampling, Frame Budget=32-frame2025.06 | 23.8 | |
| InternVL3.5 + ReFoCUSLLM Size=4B, Sampling Strategy=ReFoCUS, Frame Budget=32-frame2025.06 | 22.9 | |
| InternVL3.5LLM Size=4B, Sampling Strategy=Uniform sampling, Frame Budget=32-frame2025.06 | 22.1 | |
| VideoLLaMA 3 + ReFoCUSLLM Size=2B, Sampling Strategy=ReFoCUS, Frame Budget=32-frame2025.06 | 20.7 | |
| InternVL3 + ReFoCUSLLM Size=1B, Sampling Strategy=ReFoCUS, Frame Budget=32-frame2025.06 | 20.4 | |
| InternVL3LLM Size=1B, Sampling Strategy=Uniform sampling, Frame Budget=32-frame2025.06 | 20 | |
| LLaVA-OneVision + ReFoCUSLLM Size=0.5B, Sampling Strategy=ReFoCUS, Frame Budget=32-frame2025.06 | 18.9 | |
| VideoLLaMA 3LLM Size=2B, Sampling Strategy=Uniform sampling, Frame Budget=32-frame2025.06 | 18.9 | |
| LLaVA-OneVisionLLM Size=0.5B, Sampling Strategy=Uniform sampling, Frame Budget=32-frame2025.06 | 18.1 | |
| LLaVA-OneVision + ReFoCUSLLM Size=7B, Sampling Strategy=ReFoCUS, Frame Budget=32-frame2025.06 | 16.4 | |
| LLaVA-OneVisionLLM Size=7B, Sampling Strategy=Uniform sampling, Frame Budget=32-frame2025.06 | 16.2 | |
| Gemini 2.5 Flash + ReFoCUSLLM Size=Closed, Sampling Strategy=ReFoCUS, Frame Budget=32-frame2025.06 | 11.9 | |
| Gemini 2.5 FlashLLM Size=Closed, Sampling Strategy=Uniform sampling, Frame Budget=32-frame2025.06 | 11.7 | |
| GPT-4o + ReFoCUSLLM Size=Closed, Sampling Strategy=ReFoCUS, Frame Budget=32-frame2025.06 | 9.1 | |
| GPT-4oLLM Size=Closed, Sampling Strategy=Uniform sampling, Frame Budget=32-frame2025.06 | 8.5 |