Vocal Sound Classification on VocalSound
94.85AccuracyKimi Audio
Evaluation Results
| Method | Links | |
|---|---|---|
| Kimi Audio2026.02 | 94.85 | |
| Concat.Encoder Type=Fusion2026.06 | 94.5 | |
| Qwen2-Audio2025.02 | 93.9 | |
| Adapt. and Trans.Encoder Type=Fusion2026.06 | 93.8 | |
| WQ-FusionEncoder Type=Fusion2026.06 | 93.8 | |
| Gated Trans.Encoder Type=Fusion2026.06 | 93.6 | |
| Qwen2-Audio-7BEncoder Type=Single2026.06 | 93 | |
| Qwen-Audiozero-shot=true2023.11 | 92.89 | |
| LongCat-Flash-Omni2026.02 | 92.76 | |
| Dasheng 1.2BParameter Count=1.2B2026.01 | 92.5 | |
| Gemini-3-Pro2026.02 | 92.01 | |
| Qwen3-Omni-Instruct2026.02 | 91.6 | |
| Whisper-LargeEncoder Type=Single2026.06 | 91.6 | |
| ERNIE 5.0-Base2026.02 | 91.48 | |
| Challenge BaselineDescription=Best among Dasheng-base, data2vec, and Whisper2026.01 | 91 | |
| Ensemble (Submission)Ensemble Strategy=Embedding Concatenation2026.01 | 90.9 | |
| AudioMAEEncoder Type=Single2026.06 | 90.9 | |
| ERNIE 5.02026.02 | 90.73 | |
| Soundwave2025.02 | 90.5 | |
| BEATs (300M) SpeechParameter Count=300M, Pre-training Mixture=Speech-heavy (70:15:15)2026.01 | 87.9 | |
| BEATs (300M) BalancedParameter Count=300M, Pre-training Mixture=Balanced (40:30:30)2026.01 | 87.7 | |
| BEATs (90M) iter3Parameter Count=90M, Iteration=32026.01 | 86.5 | |
| Dasheng-BaseEncoder Type=Single2026.06 | 85.5 | |
| PALM + ASPLShots=16, Audio Encoder=CLAP-HTSAT, Text Encoder=CLIP (PENGI)2026.06 | 83.03 | |
| PALMShots=16, Audio Encoder=CLAP-HTSAT, Text Encoder=CLIP (PENGI)2026.06 | 82.64 | |
| PALM + ASPL*Shots=16, Audio Encoder=CLAP-HTSAT, Text Encoder=CLIP (PENGI)2026.06 | 82.6 | |
| GPT-4o-Audio2026.02 | 82.37 | |
| CoCoOp + ASPLShots=16, Audio Encoder=CLAP-HTSAT, Text Encoder=CLIP (PENGI)2026.06 | 82.27 | |
| CoCoOp + ASPL*Shots=16, Audio Encoder=CLAP-HTSAT, Text Encoder=CLIP (PENGI)2026.06 | 82.13 | |
| CoCoOpShots=16, Audio Encoder=CLAP-HTSAT, Text Encoder=CLIP (PENGI)2026.06 | 81.17 | |
| CoOp + ASPL*Shots=16, Audio Encoder=CLAP-HTSAT, Text Encoder=CLIP (PENGI)2026.06 | 77.28 | |
| CoOpShots=16, Audio Encoder=CLAP-HTSAT, Text Encoder=CLIP (PENGI)2026.06 | 74.57 | |
| CoOp + ASPLShots=16, Audio Encoder=CLAP-HTSAT, Text Encoder=CLIP (PENGI)2026.06 | 74.11 | |
| Pengi2025.02 | 60.4 | |
| PengiTask-specific fine-tuning=true2023.11 | 60.35 | |
| Pengi2023.05 | 60.35 | |
| CLAPTask-specific fine-tuning=true2023.11 | 49.45 | |
| CLAP2023.05 | 49.45 |