Video Question Answering on NextQA MC
86.3ScoreGPT-5
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| GPT-52026.02 | 86.3 | — | |
| Gemini 2.5 Pro2026.02 | 85.3 | — | |
| Gemini 3 Pro2026.02 | 84.3 | — | |
| LLaVA-Video-7BParameters=7B2026.02 | 83.2 | — | |
| Oryx-7BParameters=7B2026.02 | 81.9 | — | |
| CoPE-VideoLM-7BParameters=7B2026.02 | 81.8 | — | |
| LLaVA-OV-7BParameters=7B2026.02 | 79.4 | — | |
| Claude Sonnet 4.52026.02 | 79.2 | — | |
| Full ModelModel=VideoLLaMA2, Sparsity ratio=0%2025.04 | 73.3 | 100 | |
| Full ModelBackbone=VideoLLaMA2, Sparsity=0%2025.04 | 73.3 | — | |
| Full ModelBackbone=VideoLLaMA2 (7B), Sparsity Ratio=0%, Evaluation Protocol=Zero-shot2026.04 | 73.3 | 100 | |
| TopoVLM (Ours)Backbone=VideoLLaMA2 (7B), Sparsity Ratio=60%, Evaluation Protocol=Zero-shot2026.04 | 72.5 | 96.7 | |
| IXC-2.5-7BParameters=7B2026.02 | 71 | — | |
| TAMPModel=VideoLLaMA2, Sparsity ratio=60%2025.04 | 70.9 | 95 | |
| TAMPBackbone=VideoLLaMA2 (7B), Sparsity Ratio=60%, Evaluation Protocol=Zero-shot2026.04 | 70.9 | 95 | |
| LLM-StreamlineBackbone=VideoLLaMA2 (7B), Sparsity Ratio=60%, Evaluation Protocol=Zero-shot2026.04 | 70.2 | 86.5 | |
| ECOFLaPModel=VideoLLaMA2, Sparsity ratio=60%2025.04 | 69.8 | 93.8 | |
| ECoFLaPBackbone=VideoLLaMA2 (7B), Sparsity Ratio=60%, Evaluation Protocol=Zero-shot2026.04 | 69.8 | 93.8 | |
| LongVA-7BParameters=7B2026.02 | 68.3 | — | |
| VILA-40BParameters=40B2026.02 | 67.9 | — | |
| LLM-PrunerBackbone=VideoLLaMA2 (7B), Sparsity Ratio=60%, Evaluation Protocol=Zero-shot2026.04 | 65.8 | 82.1 | |
| WandaModel=VideoLLaMA2, Sparsity ratio=60%2025.04 | 65 | 91 | |
| WandaBackbone=VideoLLaMA2 (7B), Sparsity Ratio=60%, Evaluation Protocol=Zero-shot2026.04 | 65 | 91 | |
| OWLModel=VideoLLaMA2, Sparsity ratio=60%2025.04 | 63.1 | 89.4 | |
| OWLBackbone=VideoLLaMA2 (7B), Sparsity Ratio=60%, Evaluation Protocol=Zero-shot2026.04 | 63.1 | 89.4 | |
| SparseGPTModel=VideoLLaMA2, Sparsity ratio=60%2025.04 | 61.8 | 88.5 | |
| SparseGPTBackbone=VideoLLaMA2 (7B), Sparsity Ratio=60%, Evaluation Protocol=Zero-shot2026.04 | 61.8 | 88.5 | |
| Full ModelBackbone=LLaVA-OneVision, Sparsity Ratio=0%2026.04 | 58.4 | — | |
| TopoVLMBackbone=LLaVA-OneVision, Sparsity Ratio=60%2026.04 | 56.1 | — | |
| LLM-StreamlineBackbone=LLaVA-OneVision, Sparsity Ratio=60%2026.04 | 53.4 | — | |
| ECoFLaPBackbone=LLaVA-OneVision, Sparsity Ratio=60%2026.04 | 53.2 | — | |
| TAMPBackbone=LLaVA-OneVision, Sparsity Ratio=60%2026.04 | 52.5 | — | |
| SparseGPTBackbone=LLaVA-OneVision, Sparsity Ratio=60%2026.04 | 52.3 | — | |
| LLM-PrunerBackbone=LLaVA-OneVision, Sparsity Ratio=60%2026.04 | 50.6 | — | |
| WandaBackbone=LLaVA-OneVision, Sparsity Ratio=60%2026.04 | 49.3 | — | |
| OWLBackbone=LLaVA-OneVision, Sparsity Ratio=60%2026.04 | 47.6 | — | |
| ShortGPTBackbone=VideoLLaMA2, Sparsity=25%2025.04 | 25 | — | |
| DASBackbone=VideoLLaMA2, Sparsity=25%2025.04 | 25 | — | |
| OWLBackbone=VideoLLaMA2, Sparsity=25%2025.04 | 21.5 | — | |
| Shortened LLaMABackbone=VideoLLaMA2, Sparsity=25%2025.04 | 21.3 | — | |
| MagnitudeModel=VideoLLaMA2, Sparsity ratio=60%2025.04 | 20.3 | 12.6 | |
| MagnitudeBackbone=VideoLLaMA2 (7B), Sparsity Ratio=60%, Evaluation Protocol=Zero-shot2026.04 | 20.3 | 12.6 | |
| ECOFLaPBackbone=VideoLLaMA2, Sparsity=25%2025.04 | 19.8 | — | |
| MagnitudeBackbone=LLaVA-OneVision, Sparsity Ratio=60%2026.04 | 0 | — |