Multimodal Sequencing on WikiHow Golden (test)
91.03AccHuman Performance
Evaluation Results
| Method | Links | ||||||
|---|---|---|---|---|---|---|---|
| Human PerformanceModality=Multimodal2021.10 | 91.03 | 79.61 | 4.78 | 4.46 | 0.94 | 0.52 | |
| Human PerformanceModality=Text-Only2021.10 | 83.35 | 66.91 | 4.63 | 4.11 | 0.89 | 1.06 | |
| CLIP-ViLModality=Multimodal, Encoders=CLIP-ViL, Sequence-aware Pretraining=Y2021.10 | 79.87 | 65.67 | 4.57 | 4.05 | 0.85 | 1.44 | |
| VisualBERTModality=Multimodal, Encoders=VisualBERT, Sequence-aware Pretraining=Y2021.10 | 77.3 | 59.67 | 4.5 | 3.86 | 0.83 | 1.58 | |
| CLIP-ViLModality=Multimodal, Encoders=CLIP-ViL, Sequence-aware Pretraining=N2021.10 | 76.15 | 59 | 4.49 | 3.87 | 0.82 | 1.68 | |
| RoBERTaModality=Text-Only, Encoders=RoBERTa, Sequence-aware Pretraining=Y2021.10 | 75.68 | 58.67 | 4.5 | 3.87 | 0.82 | 1.69 | |
| VisualBERTModality=Multimodal, Encoders=VisualBERT, Sequence-aware Pretraining=N2021.10 | 75.3 | 57.33 | 4.45 | 3.83 | 0.81 | 1.65 | |
| RoBERTaModality=Text-Only, Encoders=RoBERTa, Sequence-aware Pretraining=N2021.10 | 74.75 | 56.67 | 4.47 | 3.78 | 0.82 | 1.71 | |
| Human PerformanceModality=Image-Only2021.10 | 68.16 | 47.49 | 4.27 | 3.51 | 0.72 | 2.43 | |
| CLIPModality=Image-Only, Encoders=CLIP, Sequence-aware Pretraining=Y2021.10 | 28.24 | 5 | 3.09 | 1.96 | 0.16 | 6.8 | |
| CLIPModality=Image-Only, Encoders=CLIP, Sequence-aware Pretraining=N2021.10 | 24.92 | 3.33 | 2.95 | 1.84 | 0.08 | 7.32 | |
| ResNetModality=Image-Only, Encoders=ResNet, Sequence-aware Pretraining=N2021.10 | 21.73 | 2 | 2.81 | 1.73 | 0.01 | 7.87 |