Multimodal Sentiment Analysis on CMU-MOSEI
0.528MAEUMQ
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| UMQNR=0.22026.03 | 0.528 | 87 | — | |
| UMQNR=0.32026.03 | 0.53 | 86.7 | — | |
| UMQNR=0.12026.03 | 0.531 | 87.3 | — | |
| UMQNR=0.42026.03 | 0.536 | 87 | — | |
| UMQNR=0.52026.03 | 0.543 | 86.6 | — | |
| Multimodal BoostingNR=0.12026.03 | 0.544 | 86.4 | — | |
| C-MIBNR=0.12026.03 | 0.545 | 86.1 | — | |
| UMQNR=Avg2026.03 | 0.551 | 86.5 | — | |
| Multimodal BoostingNR=0.22026.03 | 0.557 | 86.6 | — | |
| UMQNR=0.62026.03 | 0.573 | 85.6 | — | |
| C-MIBNR=0.22026.03 | 0.582 | 84.5 | — | |
| UMQNR=0.72026.03 | 0.616 | 85.5 | — | |
| C-MIBNR=0.32026.03 | 0.622 | 85.6 | — | |
| Multimodal BoostingNR=0.32026.03 | 0.623 | 85.5 | — | |
| Multimodal BoostingNR=0.42026.03 | 0.682 | 85.3 | — | |
| C-MIBNR=0.42026.03 | 0.703 | 84.4 | — | |
| Multimodal BoostingNR=0.52026.03 | 0.724 | 84.1 | — | |
| CM-BERTArchitecture=Encoder-Decoder2026.06 | 0.729 | — | 84.5 | |
| CL-DMDFArchitecture=Graph-Based2026.06 | 0.737 | — | 85.4 | |
| Multimodal BoostingNR=Avg2026.03 | 0.74 | 84.8 | — | |
| C-MIBNR=Avg2026.03 | 0.826 | 83.9 | — | |
| MUITArchitecture=Encoder-Decoder2026.06 | 0.871 | — | 83 | |
| C-MIBNR=0.52026.03 | 0.875 | 83.7 | — | |
| LRMFArchitecture=Encoder-Decoder2026.06 | 0.912 | — | 76.4 | |
| MLTCArchitecture=Graph-Based2026.06 | 0.922 | — | 78.4 | |
| Multimodal BoostingNR=0.62026.03 | 0.924 | 85.4 | — | |
| MFMArchitecture=Encoder-Decoder2026.06 | 0.951 | — | 78.1 | |
| MARNArchitecture=Attention-Based2026.06 | 0.968 | — | 77.1 | |
| C-MIBNR=0.62026.03 | 1.054 | 82.4 | — | |
| Multimodal BoostingNR=0.72026.03 | 1.125 | 80.3 | — | |
| C-MIBNR=0.72026.03 | 1.404 | 80.5 | — | |
| Multilogue-NetVision Input=true, Text Input=true, Audio Input=true2022.09 | — | 75.2 | — | |
| TVLTVision Input=true, Audio Input=true, Pretrain Datasets=HT100M2022.09 | — | 75.3 | — | |
| TVLTVision Input=true, Audio Input=true, Pretrain Datasets=YTT-S2022.09 | — | 76.8 | — |