Speech Emotion Recognition on IEMOCAP (4-class test)
63.5WALocal attention
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| Local attentionBackbone=Transformer, Training Epochs=60, Reference=Mirsamadi et al. (2017)2019.09 | 63.5 | 58.8 | |
| Alleviated TOIP-value=10, Backbone=Transformer (smaller version), Training Epochs=60, Window Sizes=Aggregate of 100, 200, 300, 400, 500 frames2019.09 | 61.7 | 57.1 | |
| Alleviated TOIP-value=5, Backbone=Transformer (smaller version), Training Epochs=60, Window Sizes=Aggregate of 100, 200, 300, 400, 500 frames2019.09 | 60.8 | 56.2 | |
| Alleviated TOIP-value=3, Backbone=Transformer (smaller version), Training Epochs=60, Window Sizes=Aggregate of 100, 200, 300, 400, 500 frames2019.09 | 60.5 | 56.3 | |
| Alleviated TOIP-value=2, Backbone=Transformer (smaller version), Training Epochs=60, Window Sizes=Aggregate of 100, 200, 300, 400, 500 frames2019.09 | 59.4 | 54.9 | |
| Alleviated TOIP-value=1, Backbone=Transformer (smaller version), Training Epochs=60, Window Sizes=Aggregate of 100, 200, 300, 400, 500 frames2019.09 | 59.1 | 54.3 |