Acoustic Scene Classification on TUT 2017
83.14AccuracyPALM + ASPL*
Evaluation Results
| Method | Links | |
|---|---|---|
| PALM + ASPL*Shots=16, Audio Encoder=CLAP-HTSAT, Text Encoder=CLIP (PENGI)2026.06 | 83.14 | |
| PALM + ASPLShots=16, Audio Encoder=CLAP-HTSAT, Text Encoder=CLIP (PENGI)2026.06 | 82.51 | |
| PALMShots=16, Audio Encoder=CLAP-HTSAT, Text Encoder=CLIP (PENGI)2026.06 | 79.8 | |
| CoCoOp + ASPL*Shots=16, Audio Encoder=CLAP-HTSAT, Text Encoder=CLIP (PENGI)2026.06 | 78.76 | |
| CoCoOp + ASPLShots=16, Audio Encoder=CLAP-HTSAT, Text Encoder=CLIP (PENGI)2026.06 | 78.68 | |
| CoCoOpShots=16, Audio Encoder=CLAP-HTSAT, Text Encoder=CLIP (PENGI)2026.06 | 75.84 | |
| CoOp + ASPLShots=16, Audio Encoder=CLAP-HTSAT, Text Encoder=CLIP (PENGI)2026.06 | 74.9 | |
| CoOp + ASPL*Shots=16, Audio Encoder=CLAP-HTSAT, Text Encoder=CLIP (PENGI)2026.06 | 74.38 | |
| Full ModelBackbone=VideoLLaMA2, Sparsity=0%2025.04 | 71.2 | |
| CoOpShots=16, Audio Encoder=CLAP-HTSAT, Text Encoder=CLIP (PENGI)2026.06 | 68.2 | |
| ShortGPTBackbone=VideoLLaMA2, Sparsity=25%2025.04 | 42.3 | |
| DASBackbone=VideoLLaMA2, Sparsity=25%2025.04 | 33.5 | |
| OWLBackbone=VideoLLaMA2, Sparsity=25%2025.04 | 22.5 | |
| Shortened LLaMABackbone=VideoLLaMA2, Sparsity=25%2025.04 | 12.4 | |
| ECOFLaPBackbone=VideoLLaMA2, Sparsity=25%2025.04 | 5.9 |