Video-level A/H Recognition on BAH (dev val)
85.38MF1Multimodal Fusion Model
Evaluation Results
| Method | Links | |
|---|---|---|
| Multimodal Fusion ModelModality=Models IDs 1, 2, 3 and 7, Classifier=Linear Layer2026.03 | 85.38 | |
| Multimodal Fusion Model with Prototype HeadModality=Models IDs 1, 2, 3 and 7, Classifier=Linear Layer2026.03 | 83.79 | |
| Ensemble of Five Multimodal Fusion Models with Prototype HeadModality=Models IDs 1, 2, 3 and 7, Classifier=Linear Layer2026.03 | 83 | |
| Ensemble of Five Multimodal Fusion ModelsModality=Models IDs 1, 2, 3 and 7, Classifier=Linear Layer2026.03 | 81.94 | |
| Multimodal Fusion ModelModality=Models IDs 2 and 7, Classifier=Linear Layer2026.03 | 81.77 | |
| Multimodal Fusion ModelModality=Models IDs 1, 2, 3 and 4, Classifier=Linear Layer2026.03 | 80.79 | |
| Multimodal Fusion ModelModality=Models IDs 2, 3 and 7, Classifier=Linear Layer2026.03 | 79.89 | |
| Multimodal Fusion ModelModality=Models IDs 1, 2 and 7, Classifier=Linear Layer2026.03 | 79.89 | |
| Multimodal Fusion ModelModality=Models IDs 1, 2, 3 and 6, Classifier=Linear Layer2026.03 | 78.35 | |
| Multimodal Fusion ModelModality=Models IDs 1 and 2, Classifier=Linear Layer2026.03 | 78.07 | |
| Multimodal Fusion ModelModality=Models IDs 1, 2, 3 and 5, Classifier=Linear Layer2026.03 | 77.91 | |
| Multimodal Fusion ModelModality=Models IDs 2 and 3, Classifier=Linear Layer2026.03 | 77.37 | |
| Multimodal Fusion ModelModality=Models IDs 1, 2 and 3, Classifier=Linear Layer2026.03 | 76.1 | |
| Fine-tuned EmotionTextClassifierModality=Text, Classifier=MLP2026.03 | 69.28 | |
| Fusion B (divergence)Modality=Multimodal, Input Features=windowed AUs, Fusion Strategy=Divergence2026.03 | 69.12 | |
| Fine-tuned EmotionDistilRoBERTaModality=Text, Classifier=MLP2026.03 | 68.54 | |
| TF-IDFModality=Text, Classifier=Logistic Regression2026.03 | 68.3 | |
| Multimodal Fusion ModelModality=Models IDs 1, 3 and 7, Classifier=Linear Layer2026.03 | 68.08 | |
| Fusion A (implicit)Modality=Multimodal, Input Features=raw AUs, Fusion Strategy=Implicit2026.03 | 67.88 | |
| EmotionWav2Vec2.0 + MambaModality=Audio, Classifier=Linear Layer2026.03 | 67.2 | |
| Multimodal Fusion ModelModality=Models IDs 3 and 7, Classifier=Linear Layer2026.03 | 67.05 | |
| Fusion C (combined)Modality=Multimodal, Input Features=raw AUs, Fusion Strategy=Combined2026.03 | 67 | |
| TF-IDFModality=Text, Classifier=CatBoost2026.03 | 65.56 | |
| EmotionEfficientNetB0 + Statistical FeaturesModality=Face, Classifier=MLP2026.03 | 65.29 | |
| Multimodal Fusion ModelModality=Models IDs 1 and 7, Classifier=Linear Layer2026.03 | 65.29 | |
| Fusion B (divergence)Modality=Multimodal, Input Features=raw AUs, Fusion Strategy=Divergence2026.03 | 65.24 | |
| Multimodal Fusion ModelModality=Models IDs 1 and 3, Classifier=Linear Layer2026.03 | 63.36 | |
| Visual AUs (XGBoost)Modality=Unimodal, Model=XGBoost, Features=Visual AUs2026.03 | 61.94 | |
| VideoMAEModality=Scene, Classifier=Linear Layer2026.03 | 61.71 | |
| Text BERTModality=Unimodal, Model=BERT-base, Features=Text2026.03 | 57.58 | |
| Audio Wav2Vec (LSTM)Modality=Unimodal, Model=Wav2Vec 2.0 (LSTM), Features=Audio2026.03 | 52.18 |