Multimodal Sentiment Analysis on CMU-MOSEI Word Aligned (test)
51.8Accuracy (7-Class)MulT
Evaluation Results
| Method | Links | |||||
|---|---|---|---|---|---|---|
| MulT2019.06 | 51.8 | 82.5 | 82.3 | 0.58 | 0.703 | |
| OursModality=Language and vision (with reconstructed audio via knowledge-transfer network)2023.12 | 51.1 | 80 | 80.3 | 0.635 | 0.637 | |
| Full modality (ours)Modality=Full (complete modality supervision)2023.12 | 50.7 | 80.6 | 80.8 | 0.623 | 0.7 | |
| MoNIGAlignment=Word Aligned2021.11 | 50.2 | 81.8 | 82 | 0.602 | 0.682 | |
| RAVEN2019.06 | 50 | 79.1 | 79.5 | 0.614 | 0.662 | |
| RAVENAlignment=Word Aligned2021.11 | 50 | 79.1 | 79.5 | 0.614 | 0.662 | |
| MoNIGAlignment=Word Aligned, Feature Mode=pseudo2021.11 | 50 | 81 | 81.5 | 0.6 | 0.688 | |
| RAVENModality=Full2023.12 | 50 | 79.1 | 79.5 | 0.614 | 0.662 | |
| MCTN2019.06 | 49.6 | 79.8 | 80.6 | 0.609 | 0.67 | |
| MCTNAlignment=Word Aligned2021.11 | 49.6 | 79.8 | 80.6 | 0.609 | 0.67 | |
| MCTNModality=Full2023.12 | 49.6 | 79.8 | 80.6 | 0.609 | 0.67 | |
| GaussianAlignment=Word Aligned2021.11 | 49.3 | 81.6 | 81.9 | 0.613 | 0.677 | |
| EvidentialAlignment=Word Aligned2021.11 | 48.9 | 81 | 81.2 | 0.612 | 0.671 | |
| LF-LSTMFusion Strategy=Late Fusion2019.06 | 48.8 | 80.6 | 80.6 | 0.619 | 0.659 | |
| LF-LSTMAlignment=Word Aligned2021.11 | 48.8 | 80.6 | 80.6 | 0.619 | 0.659 | |
| Language and vision (ours)Modality=Language and vision (without reconstructed audio)2023.12 | 48.4 | 79.5 | 79.6 | 0.639 | 0.633 | |
| EF-LSTMFusion Strategy=Early Fusion2019.06 | 47.4 | 78.2 | 77.9 | 0.642 | 0.616 | |
| EF-LSTMAlignment=Word Aligned2021.11 | 47.4 | 78.2 | 77.9 | 0.642 | 0.616 | |
| Language only (ours)Modality=Language only2023.12 | 46.5 | 77.4 | 78.2 | 0.653 | 0.631 | |
| Graph-MFN2019.06 | 45 | 76.9 | 77 | 0.71 | 0.54 | |
| Graph-MFNModality=Full2023.12 | 45 | 76.9 | 77 | 0.71 | 0.54 | |
| Vision only (ours)Modality=Vision only2023.12 | 43.5 | 66.4 | 69.3 | 0.756 | 0.343 |