Video Question Answering on ActivityNet
53.5AccuracyFMVR-LLaVA
Evaluation Results
| Method | Links | ||||
|---|---|---|---|---|---|
| FMVR-LLaVA#Vision Tokens=7202026.03 | 53.5 | — | — | — | |
| FMVR-LLaVA#Vision Tokens=28802026.03 | 53.4 | — | — | — | |
| FMVR-LLaVA#Vision Tokens=1802026.03 | 51.1 | — | — | — | |
| VideoLLaMA37B + OutRoModel=VideoLLaMA37B, Decoding=OutRo2026.03 | 49.92 | — | — | — | |
| FMVR-LLaVA#Vision Tokens=452026.03 | 49.6 | — | — | — | |
| VideoLLaMA37BModel=VideoLLaMA37B2026.03 | 49.32 | — | — | — | |
| LLaMA-VID#Vision Tokens=1fps×22026.03 | 47.4 | — | — | — | |
| Qwen2.5-VL3BModel=Qwen2.5-VL3B2026.03 | 47.02 | — | — | — | |
| Qwen2.5-VL3B + OutRoModel=Qwen2.5-VL3B, Decoding=OutRo2026.03 | 46.87 | — | — | — | |
| Qwen3-VL8B + OutRoModel=Qwen3-VL8B, Decoding=OutRo2026.03 | 46.85 | — | — | — | |
| Qwen3-VL8BModel=Qwen3-VL8B2026.03 | 46.65 | — | — | — | |
| BT-Adapter#Vision Tokens=~2602026.03 | 45.7 | — | — | — | |
| MovieChat#Vision Tokens=655362026.03 | 45.7 | — | — | — | |
| Video-LLAVA#Vision Tokens=20482026.03 | 45.3 | — | — | — | |
| FMVR-LLaVA#Vision Tokens=52026.03 | 45.1 | — | — | — | |
| PriorTR + MergingStrategy=Merging, Evaluator=Gem2026.06 | 44.8 | — | — | 2.24 | |
| PriorTR + MergingStrategy=Merging, Evaluator=GPT2026.06 | 44.3 | — | — | 2.25 | |
| SparseVLMStrategy=Merging, Evaluator=Gem2026.06 | 44 | — | — | 2.2 | |
| SparseVLMStrategy=Merging, Evaluator=GPT2026.06 | 43.6 | — | — | 2.21 | |
| VisionZip#Vision Tokens=1362026.03 | 43 | — | — | — | |
| SparseVLM#Vision Tokens=1982026.03 | 42.6 | — | — | — | |
| Video-LLaVAStrategy=Vanilla, Evaluator=Gem2026.06 | 42.5 | — | — | 2.12 | |
| Video-LLaVAStrategy=Vanilla, Evaluator=GPT2026.06 | 42 | — | — | 2.2 | |
| PriorTRStrategy=Pruning, Evaluator=Gem2026.06 | 40.1 | — | — | 2 | |
| PriorTRStrategy=Pruning, Evaluator=GPT2026.06 | 40 | — | — | 2.04 | |
| Video-ChatGPT#Vision Tokens=~3602026.03 | 35.2 | — | — | — | |
| LLaMA Adapter#Vision Tokens=12802026.03 | 34.2 | — | — | — | |
| FastVStrategy=Pruning, Evaluator=GPT2026.06 | 34.2 | — | — | 1.83 | |
| FastVStrategy=Pruning, Evaluator=Gem2026.06 | 34.2 | — | — | 1.74 | |
| FastV#Vision Tokens=1982026.03 | 30.6 | — | — | — | |
| VideoChat#Vision Tokens=5122026.03 | 26.5 | — | — | — | |
| Video-LLAMA#Vision Tokens=10242026.03 | 12.4 | — | — | — | |
| LLaVA-NeXT-Vid.LLM=Vicuna-7B, Use Audio=×, Latency (s)=0.242025.09 | — | 49.2 | 36.5 | — | |
| LLaVA-OneVisionLLM=Qwen2-7B, Use Audio=×, Latency (s)=0.972025.09 | — | 54.7 | 42.5 | — | |
| LLaVA-VideoLLM=Qwen2-7B, Use Audio=×, Latency (s)=1.002025.09 | — | 59.1 | 47.2 | — | |
| Qwen2-VLLLM=Qwen2-7B, Use Audio=×, Latency (s)=1.632025.09 | — | 51.4 | 39.5 | — | |
| Qwen2.5-OmniLLM=Qwen2.5-7B, Use Audio=✓, Latency (s)=4.122025.09 | — | 48.3 | 38.4 | — | |
| UniMambaMiaLLM=Qwen2-7B, Use Audio=✓, Latency (s)=1.602025.09 | — | 59.9 | 49.1 | — | |
| Video-LLaMA2LLM=Mistral-7B, Use Audio=✓2025.09 | — | 50.2 | — | — |