Group-level video emotion classification on VGAF (val)
81.98AccuracyMultimodal fusion (TimeSformer, wav2vec2.0, YOLOv8)
Evaluation Results
| Method | Links | |
|---|---|---|
| Multimodal fusion (TimeSformer, wav2vec2.0, YOLOv8)Authors=Kumar et al. [122]2026.05 | 81.98 | |
| Hybrid NetworkModality=A, V, Classes=32026.05 | 74.28 | |
| MobileNet-v1Modality=A, V, Classes=32026.05 | 71.95 | |
| Fusion of 14 modelsModality=A, V, Classes=32026.05 | 71.93 | |
| EfficientNETModality=V, Classes=32026.05 | 70.33 | |
| EfficientNet-B2Modality=Video-only2021.03 | 69.84 | |
| MobileNet-v1Modality=Video-only2021.03 | 68.92 | |
| EfficientNet-B0Modality=Video-only2021.03 | 66.8 | |
| K-injection networkModality=A, V, Classes=32026.05 | 66.19 | |
| DenseNet-121 (FER+)Modality=Video-only2021.03 | 64.75 | |
| RexNet-150Modality=Video-only2021.03 | 63.58 | |
| Activity Recognition NetworksModality=Video-only2021.03 | 62.4 | |
| Resnet-50, BiLSTM and fusion SVMModality=A, V, Classes=32026.05 | 62.4 | |
| Early fusion with LSTM and MLPModality=A, V, Classes=32026.05 | 61.61 | |
| Deep SpectrumModality=A, Classes=32026.05 | 59.4 | |
| VGG-19Modality=Img, Classes=32026.05 | 52.36 | |
| Inception+LSTM (baseline)Modality=Video-only2021.03 | 52.09 | |
| Inception-V3, CNN-LSTMModality=A, V, Classes=32026.05 | 51.3 |