Audiovisual Question Answering on MUSIC-QA
100Relative (%)Full Model
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| Full ModelModel=VideoLLaMA2, Sparsity ratio=0%2025.04 | 100 | 79.4 | — | |
| Full ModelBackbone=VideoLLaMA2 (7B), Sparsity Ratio=0%, Evaluation Protocol=Zero-shot2026.04 | 100 | — | 79.4 | |
| TopoVLM (Ours)Backbone=VideoLLaMA2 (7B), Sparsity Ratio=60%, Evaluation Protocol=Zero-shot2026.04 | 96.7 | — | 72.5 | |
| TAMPModel=VideoLLaMA2, Sparsity ratio=60%2025.04 | 95 | 72.6 | — | |
| TAMPBackbone=VideoLLaMA2 (7B), Sparsity Ratio=60%, Evaluation Protocol=Zero-shot2026.04 | 95 | — | 72.6 | |
| ECOFLaPModel=VideoLLaMA2, Sparsity ratio=60%2025.04 | 93.8 | 73 | — | |
| ECoFLaPBackbone=VideoLLaMA2 (7B), Sparsity Ratio=60%, Evaluation Protocol=Zero-shot2026.04 | 93.8 | — | 73 | |
| WandaModel=VideoLLaMA2, Sparsity ratio=60%2025.04 | 91 | 73.3 | — | |
| WandaBackbone=VideoLLaMA2 (7B), Sparsity Ratio=60%, Evaluation Protocol=Zero-shot2026.04 | 91 | — | 73.3 | |
| OWLModel=VideoLLaMA2, Sparsity ratio=60%2025.04 | 89.4 | 68.9 | — | |
| OWLBackbone=VideoLLaMA2 (7B), Sparsity Ratio=60%, Evaluation Protocol=Zero-shot2026.04 | 89.4 | — | 68.9 | |
| SparseGPTModel=VideoLLaMA2, Sparsity ratio=60%2025.04 | 88.5 | 70.6 | — | |
| SparseGPTBackbone=VideoLLaMA2 (7B), Sparsity Ratio=60%, Evaluation Protocol=Zero-shot2026.04 | 88.5 | — | 70.6 | |
| LLM-StreamlineBackbone=VideoLLaMA2 (7B), Sparsity Ratio=60%, Evaluation Protocol=Zero-shot2026.04 | 86.5 | — | 71.8 | |
| LLM-PrunerBackbone=VideoLLaMA2 (7B), Sparsity Ratio=60%, Evaluation Protocol=Zero-shot2026.04 | 82.1 | — | 66.2 | |
| MagnitudeModel=VideoLLaMA2, Sparsity ratio=60%2025.04 | 12.6 | 0 | — | |
| MagnitudeBackbone=VideoLLaMA2 (7B), Sparsity Ratio=60%, Evaluation Protocol=Zero-shot2026.04 | 12.6 | — | 0 | |
| DASBackbone=VideoLLaMA2, Sparsity=25%2025.04 | — | — | 45.8 | |
| ECOFLaPBackbone=VideoLLaMA2, Sparsity=25%2025.04 | — | — | 26.8 | |
| Full ModelBackbone=VideoLLaMA2, Sparsity=0%2025.04 | — | — | 79.4 | |
| OWLBackbone=VideoLLaMA2, Sparsity=25%2025.04 | — | — | 36.8 | |
| Shortened LLaMABackbone=VideoLLaMA2, Sparsity=25%2025.04 | — | — | 25.7 | |
| ShortGPTBackbone=VideoLLaMA2, Sparsity=25%2025.04 | — | — | 44.8 |