Visual Question Answering on VQA (test-val)
76.48AccuracyBaseline
Evaluation Results
| Method | Links | |
|---|---|---|
| BaselineBase Model=CLIP-ViL, Training Protocol=Re-Pretrain2022.04 | 76.48 | |
| MADBase Model=VILLA, Training Protocol=Only Finetune, Teacher Visual Encoder=CLIP-V, Teacher Text Encoder=CLIP-T2022.04 | 75.81 | |
| BaselineBase Model=VILLA, Training Protocol=Only Finetune2022.04 | 74.69 | |
| BaselineBase Model=UNITER, Training Protocol=Only Finetune2022.04 | 73.82 | |
| BaselineBase Model=VL-BERT, Training Protocol=Only Finetune2022.04 | 71.79 |