Group Emotion Recognition on VGAF 2023 (val)
79.24AccuracyOurs v4
Evaluation Results
| Method | Links | |
|---|---|---|
| Ours v4Modalities=Synthetic video + Video, Aggregation strategy=Avg. Pooling, Context=EmotiW20232026.05 | 79.24 | |
| Ours v7Modalities=Audio + Synthetic video + Video, Aggregation strategy=Frames Attention Pooling (FAP)2026.05 | 79.11 | |
| Ours v6Modalities=Audio + Synthetic video + Video, Aggregation strategy=Avg. Pooling, Context=EmotiW20232026.05 | 78.72 | |
| Ours v5Modalities=Audio + Synthetic video + Video, Aggregation strategy=Avg. Pooling, Context=EmotiW20232026.05 | 78.07 | |
| Liu et al.Modalities=Audio+Video, Individual features=true2026.05 | 74.28 | |
| Ours v3Modalities=Video, Aggregation strategy=Avg. Pooling2026.05 | 74.15 | |
| BelovaModalities=Audio+Video2026.05 | 71.95 | |
| Sun et al.Modalities=Audio+Video, Individual features=true2026.05 | 71.93 | |
| Savchenko et al.Modalities=Video, Individual features=true2026.05 | 70.23 | |
| Wang et al.Modalities=Audio+Video2026.05 | 66.19 | |
| Pinto et al.Modalities=Audio+Video2026.05 | 65.74 | |
| Sharma et al.Modalities=Audio+Video, Individual features=true2026.05 | 61.61 | |
| EvtodienkoModalities=Audio+Video2026.05 | 60.37 | |
| Ours v2Modalities=Synthetic video, Aggregation strategy=Avg. Pooling, Context=EmotiW20232026.05 | 60.05 | |
| Ottl et al.Modalities=Audio2026.05 | 59.4 | |
| Ours v1Modalities=Audio, Aggregation strategy=Avg. Pooling, Context=EmotiW20232026.05 | 56.4 | |
| Petrova et al.Modalities=Video2026.05 | 52.36 | |
| baselineModalities=A+V2026.05 | 51.3 |