Sound Event Detection on TUT 2017
71.2AccuracyFull Model
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| Full ModelBackbone=VideoLLaMA2 (7B), Sparsity Ratio=0%, Evaluation Protocol=Zero-shot2026.04 | 71.2 | 100 | |
| TopoVLM (Ours)Backbone=VideoLLaMA2 (7B), Sparsity Ratio=60%, Evaluation Protocol=Zero-shot2026.04 | 70.8 | 96.7 | |
| OWLBackbone=VideoLLaMA2 (7B), Sparsity Ratio=60%, Evaluation Protocol=Zero-shot2026.04 | 70.5 | 89.4 | |
| TAMPBackbone=VideoLLaMA2 (7B), Sparsity Ratio=60%, Evaluation Protocol=Zero-shot2026.04 | 69.9 | 95 | |
| LLM-StreamlineBackbone=VideoLLaMA2 (7B), Sparsity Ratio=60%, Evaluation Protocol=Zero-shot2026.04 | 67.8 | 86.5 | |
| ECoFLaPBackbone=VideoLLaMA2 (7B), Sparsity Ratio=60%, Evaluation Protocol=Zero-shot2026.04 | 67.2 | 93.8 | |
| WandaBackbone=VideoLLaMA2 (7B), Sparsity Ratio=60%, Evaluation Protocol=Zero-shot2026.04 | 65.6 | 91 | |
| SparseGPTBackbone=VideoLLaMA2 (7B), Sparsity Ratio=60%, Evaluation Protocol=Zero-shot2026.04 | 64.1 | 88.5 | |
| LLM-PrunerBackbone=VideoLLaMA2 (7B), Sparsity Ratio=60%, Evaluation Protocol=Zero-shot2026.04 | 62.4 | 82.1 | |
| MagnitudeBackbone=VideoLLaMA2 (7B), Sparsity Ratio=60%, Evaluation Protocol=Zero-shot2026.04 | 0 | 12.6 |