Visual Commonsense Reasoning on VCR 1.0 (val)
80.6Q->A AccuracyMERLOT
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| MERLOTModel Size=base, Backbone Architecture=12-layer vision-and-language Transformers2021.06 | 80.6 | 80.4 | 65.1 | |
| ERNIE-ViLModel Size=base, Backbone Architecture=12-layer vision-and-language Transformers2021.06 | 77 | 80.3 | 62.1 | |
| VILLAModel Size=base, Backbone Architecture=12-layer vision-and-language Transformers2021.06 | 76.4 | 79.1 | 60.6 | |
| UNITERModel Size=base, Backbone Architecture=12-layer vision-and-language Transformers2021.06 | 75 | 77.2 | 58.2 | |
| VLBERTModel Size=base, Backbone Architecture=12-layer vision-and-language Transformers2021.06 | 73.8 | 74.4 | 55.2 | |
| Unicoder-VLModel Size=base, Backbone Architecture=12-layer vision-and-language Transformers2021.06 | 73.4 | 74.4 | 54.9 | |
| VILBERTModel Size=base, Backbone Architecture=12-layer vision-and-language Transformers2021.06 | 73.3 | 74.6 | 54.8 |