Video-level A/H Recognition on BAH (test)
82.72MF1Multimodal Fusion Model with Prototype Head
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| Multimodal Fusion Model with Prototype HeadModality=Models IDs 1, 2, 3 and 7, Classifier=Linear Layer2026.03 | 82.72 | 83.25 | — | |
| Ensemble of Five Multimodal Fusion Models with Prototype HeadModality=Models IDs 1, 2, 3 and 7, Classifier=Linear Layer2026.03 | 80.77 | 81.89 | — | |
| Ensemble of Five Multimodal Fusion ModelsModality=Models IDs 1, 2, 3 and 7, Classifier=Linear Layer2026.03 | 80.64 | 81.29 | — | |
| Multimodal Fusion ModelModality=Models IDs 1, 2, 3 and 7, Classifier=Linear Layer2026.03 | 79.94 | 82.66 | — | |
| Multimodal Fusion ModelModality=Models IDs 1, 2 and 3, Classifier=Linear Layer2026.03 | 79.15 | 77.62 | — | |
| Multimodal Fusion ModelModality=Models IDs 2 and 7, Classifier=Linear Layer2026.03 | 79 | 80.39 | — | |
| Multimodal Fusion ModelModality=Models IDs 1, 2, 3 and 5, Classifier=Linear Layer2026.03 | 78.54 | 78.22 | — | |
| Multimodal Fusion ModelModality=Models IDs 2 and 3, Classifier=Linear Layer2026.03 | 77.66 | 77.51 | — | |
| Multimodal Fusion ModelModality=Models IDs 1, 2 and 7, Classifier=Linear Layer2026.03 | 77.65 | 78.77 | — | |
| Multimodal Fusion ModelModality=Models IDs 2, 3 and 7, Classifier=Linear Layer2026.03 | 77.63 | 78.76 | — | |
| Multimodal Fusion ModelModality=Models IDs 1 and 2, Classifier=Linear Layer2026.03 | 77.09 | 77.58 | — | |
| Multimodal Fusion ModelModality=Models IDs 1, 2, 3 and 4, Classifier=Linear Layer2026.03 | 77.03 | 78.91 | — | |
| Multimodal Fusion ModelModality=Models IDs 1, 2, 3 and 6, Classifier=Linear Layer2026.03 | 77.03 | 77.69 | — | |
| TF-IDFModality=Text, Classifier=CatBoost2026.03 | 72.02 | 68.79 | — | |
| Fine-tuned EmotionDistilRoBERTaModality=Text, Classifier=MLP2026.03 | 71.49 | 70.02 | — | |
| Multimodal Fusion ModelModality=Models IDs 1 and 3, Classifier=Linear Layer2026.03 | 71.44 | 67.4 | — | |
| Ensemble of Five Multimodal Fusion Models with Prototype HeadModality=Models IDs 1, 2, 3 and 7, Classifier=Linear Layer2026.03 | 71.43 | — | — | |
| Multimodal Fusion ModelModality=Models IDs 3 and 7, Classifier=Linear Layer2026.03 | 70.99 | 69.02 | — | |
| EmotionWav2Vec2.0 + MambaModality=Audio, Classifier=Linear Layer2026.03 | 70.87 | 69.03 | — | |
| Fine-tuned EmotionTextClassifierModality=Text, Classifier=MLP2026.03 | 70.72 | 70 | — | |
| Multimodal Fusion ModelModality=Models IDs 1, 3 and 7, Classifier=Linear Layer2026.03 | 70.41 | 69.25 | — | |
| Ensemble of Five Multimodal Fusion ModelsModality=Models IDs 1, 2, 3 and 7, Classifier=Linear Layer2026.03 | 70.17 | — | — | |
| Multimodal Fusion ModelModality=Models IDs 1, 2, 3 and 7, Classifier=Linear Layer2026.03 | 68.32 | — | — | |
| TF-IDFModality=Text, Classifier=Logistic Regression2026.03 | 67.75 | 68.03 | — | |
| Multimodal Fusion Model with Prototype HeadModality=Models IDs 1, 2, 3 and 7, Classifier=Linear Layer2026.03 | 65.21 | — | — | |
| VideoMAEModality=Scene, Classifier=Linear Layer2026.03 | 62.21 | 61.96 | — | |
| Multimodal Fusion ModelModality=Models IDs 1 and 7, Classifier=Linear Layer2026.03 | 61.19 | 63.24 | — | |
| EmotionEfficientNetB0 + Statistical FeaturesModality=Face, Classifier=MLP2026.03 | 60.05 | 62.67 | — | |
| Audio Wav2Vec (LSTM)Modality=Unimodal, Model=Wav2Vec 2.0 (LSTM), Features=Audio2026.03 | — | — | 61.41 | |
| Challenge baselineReference=[7]2026.03 | — | — | 28.27 | |
| Fusion A (implicit)Modality=Multimodal, Input Features=raw AUs, Fusion Strategy=Implicit2026.03 | — | — | 66.04 | |
| Fusion B (divergence)Modality=Multimodal, Input Features=raw AUs, Fusion Strategy=Divergence2026.03 | — | — | 68.08 | |
| Fusion B (divergence)Modality=Multimodal, Input Features=windowed AUs, Fusion Strategy=Divergence2026.03 | — | — | 66.02 | |
| Fusion C (combined)Modality=Multimodal, Input Features=raw AUs, Fusion Strategy=Combined2026.03 | — | — | 67.66 | |
| Text BERTModality=Unimodal, Model=BERT-base, Features=Text2026.03 | — | — | 59.04 | |
| Visual AUs (XGBoost)Modality=Unimodal, Model=XGBoost, Features=Visual AUs2026.03 | — | — | 56.42 |