Emotion Recognition on RAVDESS (speaker-independent)
82.29UARwav2vec 2.0 with data augmentation
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| wav2vec 2.0 with data augmentation#Params=317.0 M2026.06 | 82.29 | — | |
| Fine-tuned xlsr-wav2vec 2.0#Params=317.0 M2026.06 | 81.82 | — | |
| Fine-tuned CNN14#Params=81.0 M2026.06 | 76.58 | — | |
| ResLSTM-SA-h64#Params=0.05 M2026.06 | 65.17 | — | |
| Fine-tuned AlexNet#Params=61.0 M2026.06 | 61.67 | — | |
| GResNet+S2026.06 | 59.7 | — | |
| CNN+LSTM2026.06 | 56.71 | — | |
| AlexNet embeddings + SVM#Params=61.0 M2026.06 | 45.8 | — | |
| ASR-onlyToken Category=Single-task Optimized, alpha (α)=02026.01 | — | 41.7 | |
| Discrete WavLMToken Category=Baseline (phonetic)2026.01 | — | 41.7 | |
| Phonological TokenizerToken Category=Proposed, alpha (α)=0.12026.01 | — | 51.7 | |
| SpeechTokenizerToken Category=Baseline (hybrid)2026.01 | — | 39.2 | |
| Voc-onlyToken Category=Single-task Optimized, alpha (α)=12026.01 | — | 40 | |
| WavTokenizerToken Category=Baseline (acoustic)2026.01 | — | 24.2 |