Speech Emotion Recognition on IEMOCAP Speaker-Independent (test)
73.01WAPF-hbt-large
Evaluation Results
| Method | Links | |
|---|---|---|
| PF-hbt-largeFine-tuning strategy=Partial, Backbone architecture=HuBERT, Model scale=Large, ASR fine-tuning=No2021.11 | 73.01 | |
| PF-hbt-large-960hFine-tuning strategy=Partial, Backbone architecture=HuBERT, Model scale=Large, ASR fine-tuning=960h2021.11 | 72.98 | |
| EF-hbt-large-960hFine-tuning strategy=Entire, Backbone architecture=HuBERT, Model scale=Large, ASR fine-tuning=960h2021.11 | 72.71 | |
| EF-hbt-largeFine-tuning strategy=Entire, Backbone architecture=HuBERT, Model scale=Large, ASR fine-tuning=No2021.11 | 72.31 | |
| Attention Pooling2021.11 | 71.75 | |
| PF-w2v-largeFine-tuning strategy=Partial, Backbone architecture=wav2vec 2.0, Model scale=Large, ASR fine-tuning=No2021.11 | 70.99 | |
| EF-w2v-largeFine-tuning strategy=Entire, Backbone architecture=wav2vec 2.0, Model scale=Large, ASR fine-tuning=No2021.11 | 70.96 | |
| EF-w2v-baseFine-tuning strategy=Entire, Backbone architecture=wav2vec 2.0, Model scale=Base, ASR fine-tuning=No2021.11 | 70.75 | |
| PF-w2v-baseFine-tuning strategy=Partial, Backbone architecture=wav2vec 2.0, Model scale=Base, ASR fine-tuning=No2021.11 | 70.21 | |
| EF-hbt-baseFine-tuning strategy=Entire, Backbone architecture=HuBERT, Model scale=Base, ASR fine-tuning=No2021.11 | 69.83 | |
| PF-hbt-baseFine-tuning strategy=Partial, Backbone architecture=HuBERT, Model scale=Base, ASR fine-tuning=No2021.11 | 69.68 | |
| PF-w2v-large-960hFine-tuning strategy=Partial, Backbone architecture=wav2vec 2.0, Model scale=Large, ASR fine-tuning=960h2021.11 | 69.08 | |
| PF-w2v-base-960hFine-tuning strategy=Partial, Backbone architecture=wav2vec 2.0, Model scale=Base, ASR fine-tuning=960h2021.11 | 68.34 | |
| EF-w2v-large-960hFine-tuning strategy=Entire, Backbone architecture=wav2vec 2.0, Model scale=Large, ASR fine-tuning=960h2021.11 | 68.18 | |
| Frozen-hbt-largeFine-tuning strategy=Frozen, Backbone architecture=HuBERT, Model scale=Large2021.11 | 67.62 | |
| Frozen-w2v-largeFine-tuning strategy=Frozen, Backbone architecture=wav2vec 2.0, Model scale=Large2021.11 | 65.64 | |
| Frozen-hbt-baseFine-tuning strategy=Frozen, Backbone architecture=HuBERT, Model scale=Base2021.11 | 64.92 | |
| EF-w2v-base-960hFine-tuning strategy=Entire, Backbone architecture=wav2vec 2.0, Model scale=Base, ASR fine-tuning=960h2021.11 | 64.2 | |
| Frozen-w2v-baseFine-tuning strategy=Frozen, Backbone architecture=wav2vec 2.0, Model scale=Base2021.11 | 63.43 |