Music Understanding on Mucho music
75.6AccuracyAF-Next-Instruct
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| AF-Next-Instruct2026.04 | 75.6 | — | — | |
| Music Flamingo2026.04 | 74.5 | — | — | |
| Full ModelBackbone=VideoLLaMA2, Sparsity=0%2025.04 | 58.9 | — | — | |
| Full ModelBackbone=VideoLLaMA2 (7B), Sparsity Ratio=0%, Evaluation Protocol=Zero-shot2026.04 | 58.9 | — | 100 | |
| TopoVLM (Ours)Backbone=VideoLLaMA2 (7B), Sparsity Ratio=60%, Evaluation Protocol=Zero-shot2026.04 | 58.1 | — | 96.7 | |
| LLM-StreamlineBackbone=VideoLLaMA2 (7B), Sparsity Ratio=60%, Evaluation Protocol=Zero-shot2026.04 | 56.3 | — | 86.5 | |
| TAMPBackbone=VideoLLaMA2 (7B), Sparsity Ratio=60%, Evaluation Protocol=Zero-shot2026.04 | 55.9 | — | 95 | |
| ECoFLaPBackbone=VideoLLaMA2 (7B), Sparsity Ratio=60%, Evaluation Protocol=Zero-shot2026.04 | 54.4 | — | 93.8 | |
| WandaBackbone=VideoLLaMA2 (7B), Sparsity Ratio=60%, Evaluation Protocol=Zero-shot2026.04 | 51.4 | — | 91 | |
| LLM-PrunerBackbone=VideoLLaMA2 (7B), Sparsity Ratio=60%, Evaluation Protocol=Zero-shot2026.04 | 51.2 | — | 82.1 | |
| SparseGPTBackbone=VideoLLaMA2 (7B), Sparsity Ratio=60%, Evaluation Protocol=Zero-shot2026.04 | 48.8 | — | 88.5 | |
| OWLBackbone=VideoLLaMA2 (7B), Sparsity Ratio=60%, Evaluation Protocol=Zero-shot2026.04 | 47.6 | — | 89.4 | |
| ShortGPTBackbone=VideoLLaMA2, Sparsity=25%2025.04 | 31.6 | — | — | |
| DASBackbone=VideoLLaMA2, Sparsity=25%2025.04 | 28.9 | — | — | |
| ECOFLaPBackbone=VideoLLaMA2, Sparsity=25%2025.04 | 27.5 | — | — | |
| MagnitudeBackbone=VideoLLaMA2 (7B), Sparsity Ratio=60%, Evaluation Protocol=Zero-shot2026.04 | 25.8 | — | 12.6 | |
| OWLBackbone=VideoLLaMA2, Sparsity=25%2025.04 | 24.9 | — | — | |
| Shortened LLaMABackbone=VideoLLaMA2, Sparsity=25%2025.04 | 24.6 | — | — | |
| ECOFLaPModel=VideoLLaMA2, Sparsity ratio=60%2025.04 | — | 54.4 | 93.8 | |
| Full ModelModel=VideoLLaMA2, Sparsity ratio=0%2025.04 | — | 58.9 | 100 | |
| MagnitudeModel=VideoLLaMA2, Sparsity ratio=60%2025.04 | — | 25.8 | 12.6 | |
| OWLModel=VideoLLaMA2, Sparsity ratio=60%2025.04 | — | 47.6 | 89.4 | |
| SparseGPTModel=VideoLLaMA2, Sparsity ratio=60%2025.04 | — | 48.8 | 88.5 | |
| TAMPModel=VideoLLaMA2, Sparsity ratio=60%2025.04 | — | 55.9 | 95 | |
| WandaModel=VideoLLaMA2, Sparsity ratio=60%2025.04 | — | 51.4 | 91 |