Audiovisual Emotion Recognition on RAVDESS
81.58Accuracy (AV)Intermediate Attention fusion (IA1)
Evaluation Results
| Method | Links | ||||
|---|---|---|---|---|---|
| Intermediate Attention fusion (IA1)Modality Dropout Setting=Modality Dropout, Fusion Variant=IA12022.01 | 81.58 | 58.08 | 72.83 | 70.83 | |
| Late Transformer fusion (LT1)Modality Dropout Setting=None, Fusion Variant=LT12022.01 | 79.33 | 19.83 | 36.41 | 45.19 | |
| Intermediate Transformer fusion (IT4)Modality Dropout Setting=None, Fusion Variant=IT42022.01 | 78.5 | 20.33 | 17.33 | 38.72 | |
| Intermediate Attention fusion (IA1)Modality Dropout Setting=Modality Dropout with Noise, Fusion Variant=IA12022.01 | 78.25 | 58.25 | 71.66 | 69.38 | |
| TAVModality Dropout Setting=None2022.01 | 77.75 | 24.25 | 13.33 | 38.44 | |
| Intermediate Attention fusion (IA4)Modality Dropout Setting=None, Fusion Variant=IA42022.01 | 77.41 | 20.66 | 29.83 | 42.63 | |
| Late Transformer fusion (LT4)Modality Dropout Setting=None, Fusion Variant=LT42022.01 | 76.42 | 27.92 | 30 | 44.78 | |
| Intermediate Transformer fusion (IT1)Modality Dropout Setting=None, Fusion Variant=IT12022.01 | 76.41 | 21.16 | 18.33 | 38.63 | |
| Intermediate Attention fusion (IA1)Modality Dropout Setting=None, Fusion Variant=IA12022.01 | 76 | 18.58 | 22.83 | 39.13 | |
| TVAModality Dropout Setting=None2022.01 | 76 | 15.16 | 42.67 | 44.61 | |
| MULTModality Dropout Setting=None2022.01 | 74.16 | 22.33 | 35.42 | 43.97 | |
| Audio-visual fusion2026.05 | 67.7 | — | — | — |