Speech Emotion Recognition on RAVDESS
92.58Unweighted AccuracyPL-Distill
Evaluation Results
| Method | Links | |||||
|---|---|---|---|---|---|---|
| PL-DistillType=Student Models2026.02 | 92.58 | 92.08 | 92.23 | — | — | |
| LLaVA-KDType=Student Models2026.02 | 89.36 | 88.75 | 88.03 | — | — | |
| Reverse KLType=Student Models2026.02 | 87.74 | 86.67 | 84.03 | — | — | |
| ZS-Fuse (WavLM-Large + clsp)Foundation Model=WavLM-Large, Audio-Language Model=clsp2026.03 | 87.11 | — | — | — | — | |
| Forward KLType=Student Models2026.02 | 85.54 | 87.08 | 84.6 | — | — | |
| WavLM-Large + noneFoundation Model=WavLM-Large, Audio-Language Model=none2026.03 | 84.38 | — | — | — | — | |
| emotion2vecDownstream=Linear2023.12 | 82.86 | 82.43 | 82.39 | — | — | |
| SFTType=Student Models2026.02 | 82.67 | 76.67 | 74.48 | — | — | |
| ZS-Fuse (HuBERT-Large + clsp)Foundation Model=HuBERT-Large, Audio-Language Model=clsp2026.03 | 82.42 | — | — | — | — | |
| ZS-Fuse (WavLM-Large + reclap)Foundation Model=WavLM-Large, Audio-Language Model=reclap2026.03 | 81.25 | — | — | — | — | |
| HuBERT-Base + noneFoundation Model=HuBERT-Base, Audio-Language Model=none2026.03 | 81.25 | — | — | — | — | |
| HuBERT-Large + noneFoundation Model=HuBERT-Large, Audio-Language Model=none2026.03 | 81.25 | — | — | — | — | |
| ZS-Fuse (WavLM-Large + clap)Foundation Model=WavLM-Large, Audio-Language Model=clap2026.03 | 80.86 | — | — | — | — | |
| data2vec 2.0Downstream=Linear2023.12 | 80.8 | 81.04 | 80.97 | — | — | |
| ZS-Fuse (WavLM-Base+ + reclap)Foundation Model=WavLM-Base+, Audio-Language Model=reclap2026.03 | 79.69 | — | — | — | — | |
| ZS-Fuse (HuBERT-Base + clsp)Foundation Model=HuBERT-Base, Audio-Language Model=clsp2026.03 | 79.69 | — | — | — | — | |
| ZS-Fuse (HuBERT-Base + clap)Foundation Model=HuBERT-Base, Audio-Language Model=clap2026.03 | 75.78 | — | — | — | — | |
| ZS-Fuse (HuBERT-Large + clap)Foundation Model=HuBERT-Large, Audio-Language Model=clap2026.03 | 75.39 | — | — | — | — | |
| ZS-Fuse (HuBERT-Large + reclap)Foundation Model=HuBERT-Large, Audio-Language Model=reclap2026.03 | 75.39 | — | — | — | — | |
| Whisper large v3Type=Pretrained Models2026.02 | 75.32 | 75.87 | 75.19 | — | — | |
| ZS-Fuse (WavLM-Base+ + clsp)Foundation Model=WavLM-Base+, Audio-Language Model=clsp2026.03 | 75 | — | — | — | — | |
| ZS-Fuse (HuBERT-Base + reclap)Foundation Model=HuBERT-Base, Audio-Language Model=reclap2026.03 | 74.22 | — | — | — | — | |
| WavLM largeType=Pretrained Models2026.02 | 72 | 72.22 | 71.42 | — | — | |
| data2vec 2.0 largeType=Pretrained Models2026.02 | 71.15 | 71.63 | 70.94 | — | — | |
| data2vecDownstream=Linear2023.12 | 69.7 | 69.58 | 69.25 | — | — | |
| WavLM-Base+ + noneFoundation Model=WavLM-Base+, Audio-Language Model=none2026.03 | 69.53 | — | — | — | — | |
| ZS-Fuse (WavLM-Base+ + clap)Foundation Model=WavLM-Base+, Audio-Language Model=clap2026.03 | 67.19 | — | — | — | — | |
| Qwen2-AudioType=Teacher Model2026.02 | 63.67 | 63.33 | 60.84 | — | — | |
| CAREParams=160M2026.03 | 62 | — | 60.1 | — | — | |
| HuBERTParams=94M2026.03 | 55.7 | — | 53.5 | — | — | |
| SALMONNParams=7B2026.03 | 54.2 | — | 50.2 | — | — | |
| SALMONNParams=13B2026.03 | 53.4 | — | 51.9 | — | — | |
| emotion2vecParams=94M2026.03 | 51 | — | 48.5 | — | — | |
| WavLMParams=94M2026.03 | 49.1 | — | 50.5 | — | — | |
| CLSPZero-shot=true2026.01 | 46 | 46.8 | — | — | — | |
| data2vecParams=94M2026.03 | 40.8 | — | 38.5 | — | — | |
| WavLM-base+Downstream=Linear2023.12 | 38.4 | 38.89 | 37.75 | — | — | |
| WavLM-baseDownstream=Linear2023.12 | 37.11 | 37.01 | 36.08 | — | — | |
| ParaCLAPZero-shot=true2026.01 | 30.3 | 28.1 | — | — | — | |
| Random2026.03 | 26.28 | — | — | — | — | |
| LAION-AI CLAPZero-shot=true2026.01 | 13.5 | 14.4 | — | — | — | |
| GLAPZero-shot=true2026.01 | 13 | 7.8 | — | — | — | |
| SONARParams=600M2026.03 | 10.8 | — | 11.8 | — | — | |
| Atila & ŞengürFeatures=Spectrogram, Model=CRNN (CNN-LSTM + Attention)2026.06 | — | — | — | — | 89.7 | |
| Auden-Voice CLAPZero-shot=true2026.01 | — | 32.4 | — | — | — | |
| BEATsEvaluation Protocol=MLP2026.02 | — | — | — | 66.6 | — | |
| BEATsEvaluation Protocol=kNN2026.02 | — | — | — | 37.9 | — | |
| BEATs (300M) BalancedParameter Count=300M, Pre-training Mixture=Balanced (40:30:30)2026.01 | — | — | — | 63 | — | |
| BEATs (300M) SpeechParameter Count=300M, Pre-training Mixture=Speech-heavy (70:15:15)2026.01 | — | — | — | 65.5 | — | |
| BEATs (90M) iter3Parameter Count=90M, Iteration=32026.01 | — | — | — | 56.4 | — | |
| BLSP-Emo2026.04 | — | — | — | — | 72 | |
| C²SER2026.04 | — | — | — | — | 67.7 | |
| Challenge BaselineDescription=Best among Dasheng-base, data2vec, and Whisper2026.01 | — | — | — | 72.5 | — | |
| CLAPEvaluation Protocol=MLP2026.02 | — | — | — | 23.7 | — | |
| CLAPEvaluation Protocol=kNN2026.02 | — | — | — | 21.9 | — | |
| CLAP-UEvaluation Protocol=MLP2026.02 | — | — | — | 55.9 | — | |
| CLAP-UEvaluation Protocol=kNN2026.02 | — | — | — | 45.5 | — | |
| Dasheng 1.2BParameter Count=1.2B2026.01 | — | — | — | 79.3 | — | |
| Ensemble (Submission)Ensemble Strategy=Embedding Concatenation2026.01 | — | — | — | 79.2 | — | |
| FreezeEmpath2026.04 | — | — | — | — | 80 | |
| HuBERTEvaluation Protocol=MLP2026.02 | — | — | — | 58.1 | — | |
| HuBERTEvaluation Protocol=kNN2026.02 | — | — | — | 32.9 | — | |
| Kimi-Audio2026.04 | — | — | — | — | 54.9 | |
| Qwen2-Audio2026.04 | — | — | — | — | 94.2 | |
| UniWhisperEvaluation Protocol=MLP2026.02 | — | — | — | 88.2 | — | |
| UniWhisperEvaluation Protocol=kNN2026.02 | — | — | — | 70 | — | |
| VQ-MAE-S frameworkMethodology=VQ-MAE-S framework2026.05 | — | — | — | — | 84.1 | |
| wav2vec 2.0Evaluation Protocol=MLP2026.02 | — | — | — | 44.1 | — | |
| wav2vec 2.0Evaluation Protocol=kNN2026.02 | — | — | — | 15.8 | — | |
| WavLMEvaluation Protocol=MLP2026.02 | — | — | — | 68 | — | |
| WavLMEvaluation Protocol=kNN2026.02 | — | — | — | 25.2 | — | |
| WhisperEvaluation Protocol=MLP2026.02 | — | — | — | 61.3 | — | |
| WhisperEvaluation Protocol=kNN2026.02 | — | — | — | 38.5 | — | |
| Whisper-UEvaluation Protocol=MLP2026.02 | — | — | — | 59.4 | — | |
| Whisper-UEvaluation Protocol=kNN2026.02 | — | — | — | 23.9 | — | |
| Whisper-U-3Evaluation Protocol=MLP2026.02 | — | — | — | 65.6 | — | |
| Whisper-U-3Evaluation Protocol=kNN2026.02 | — | — | — | 36.8 | — |