Visual Question Answering on VQA (val)
79.54Overall AccuracyALICEMIND-MMU
Evaluation Results
| Method | Links | ||||
|---|---|---|---|---|---|
| ALICEMIND-MMU2021.11 | 79.54 | 92.47 | 70.63 | 72 | |
| Human2021.11 | 78.69 | 94.87 | 78.79 | 66.34 | |
| BaselineBase Model=CLIP-ViL, Training Protocol=Re-Pretrain, Training Data Scale=100%2022.04 | 73.91 | — | — | — | |
| MADBase Model=VILLA, Training Protocol=Only Finetune, Teacher Visual Encoder=CLIP-V, Teacher Text Encoder=CLIP-T, Training Data Scale=100%2022.04 | 73.02 | — | — | — | |
| MADBase Model=VILLA, Training Protocol=Only Finetune, Teacher Visual Encoder=CLIP-V, Teacher Text Encoder=ROBERTa, Training Data Scale=100%2022.04 | 72.43 | — | — | — | |
| BaselineBase Model=VILLA, Training Protocol=Only Finetune, Training Data Scale=100%2022.04 | 72.11 | — | — | — | |
| MADBase Model=VILLA, Training Protocol=Only Finetune, Teacher Visual Encoder=ViT, Teacher Text Encoder=CLIP-T, Training Data Scale=100%2022.04 | 72.02 | — | — | — | |
| MADBase Model=UNITER, Training Protocol=Only Finetune, Teacher Visual Encoder=CLIP-V, Teacher Text Encoder=CLIP-T, Training Data Scale=100%2022.04 | 71.94 | — | — | — | |
| MADBase Model=VL-BERT, Training Protocol=Only Finetune, Teacher Visual Encoder=CLIP-V, Teacher Text Encoder=CLIP-T, Training Data Scale=100%2022.04 | 71.42 | — | — | — | |
| BaselineBase Model=UNITER, Training Protocol=Only Finetune, Training Data Scale=100%2022.04 | 71.26 | — | — | — | |
| MDBase Model=VL-BERT, Training Protocol=Only Finetune, Teacher Visual Encoder=CLIP-V, Teacher Text Encoder=CLIP-T, Training Data Scale=100%2022.04 | 70.22 | — | — | — | |
| BaselineBase Model=VL-BERT, Training Protocol=Only Finetune, Training Data Scale=100%2022.04 | 69.05 | — | — | — | |
| MADBase Model=VILLA, Training Protocol=Only Finetune, Teacher Visual Encoder=CLIP-V, Teacher Text Encoder=CLIP-T, Training Data Scale=3%2022.04 | 66.93 | — | — | — | |
| BaselineBase Model=CLIP-ViL, Training Protocol=Re-Pretrain, Training Data Scale=3%2022.04 | 66.84 | — | — | — | |
| MADBase Model=VILLA, Training Protocol=Only Finetune, Teacher Visual Encoder=CLIP-V, Teacher Text Encoder=ROBERTa, Training Data Scale=3%2022.04 | 66.23 | — | — | — | |
| MADBase Model=VILLA, Training Protocol=Only Finetune, Teacher Visual Encoder=ViT, Teacher Text Encoder=CLIP-T, Training Data Scale=3%2022.04 | 66.1 | — | — | — | |
| MADBase Model=UNITER, Training Protocol=Only Finetune, Teacher Visual Encoder=CLIP-V, Teacher Text Encoder=CLIP-T, Training Data Scale=3%2022.04 | 65.93 | — | — | — | |
| BaselineBase Model=VILLA, Training Protocol=Only Finetune, Training Data Scale=3%2022.04 | 65.75 | — | — | — | |
| MADBase Model=VL-BERT, Training Protocol=Only Finetune, Teacher Visual Encoder=CLIP-V, Teacher Text Encoder=CLIP-T, Training Data Scale=3%2022.04 | 65.71 | — | — | — | |
| MDBase Model=VL-BERT, Training Protocol=Only Finetune, Teacher Visual Encoder=CLIP-V, Teacher Text Encoder=CLIP-T, Training Data Scale=3%2022.04 | 64.43 | — | — | — | |
| BaselineBase Model=UNITER, Training Protocol=Only Finetune, Training Data Scale=3%2022.04 | 64.43 | — | — | — | |
| BaselineBase Model=VL-BERT, Training Protocol=Only Finetune, Training Data Scale=3%2022.04 | 63.29 | — | — | — | |
| LfFBase Architecture=UpDown [3], Evaluation Protocol=VQA-CE2021.04 | 63.26 | — | — | — | |
| ESRBase Architecture=UpDown [3], Evaluation Protocol=VQA-CE2021.04 | 63.03 | — | — | — | |
| LMH + RMFEBase Architecture=UpDown [3], Evaluation Protocol=VQA-CE2021.04 | 62.97 | — | — | — | |
| RandImgBase Architecture=UpDown [3], Evaluation Protocol=VQA-CE2021.04 | 62.87 | — | — | — | |
| UpDownEvaluation Protocol=VQA-CE2021.04 | 62.83 | — | — | — | |
| QGHC+MUTAN2018.08 | 60.13 | — | — | — | |
| QGHC+concat2018.08 | 59.8 | — | — | — | |
| LMHBase Architecture=UpDown [3], Evaluation Protocol=VQA-CE2021.04 | 59.74 | — | — | — | |
| QGHC#parameters=5.4M2018.08 | 59.24 | — | — | — | |
| QGHC-1#parameters=2.1M2018.08 | 58.88 | — | — | — | |
| MUTAN+MLB#parameters=17.5M2018.08 | 58.76 | — | — | — | |
| SANVisual Features=grid features, Evaluation Protocol=VQA-CE2021.04 | 58.35 | — | — | — | |
| MUTAN#parameters=4.9M2018.08 | 58.16 | — | — | — | |
| MLB#parameters=7.7M2018.08 | 57.91 | — | — | — | |
| MCB#parameters=32M2018.08 | 57.39 | — | — | — | |
| Concat2018.08 | 56.92 | — | — | — | |
| RUBiBase Architecture=UpDown [3], Evaluation Protocol=VQA-CE2021.04 | 55.82 | — | — | — | |
| AdapterBase Model=VL-BERT, Training Protocol=Only Finetune, Teacher Visual Encoder=CLIP-V, Teacher Text Encoder=CLIP-T, Training Data Scale=100%2022.04 | 51.34 | — | — | — | |
| Question-OnlyEvaluation Protocol=VQA-CE2021.04 | 49.2 | — | — | — | |
| ShortcutsEvaluation Protocol=VQA-CE2021.04 | 44.71 | — | — | — | |
| MADBase Model=VILLA, Training Protocol=Only Finetune, Teacher Visual Encoder=CLIP-V, Teacher Text Encoder=CLIP-T, Training Data Scale=0.3%2022.04 | 40.16 | — | — | — | |
| MADBase Model=UNITER, Training Protocol=Only Finetune, Teacher Visual Encoder=CLIP-V, Teacher Text Encoder=CLIP-T, Training Data Scale=0.3%2022.04 | 39.75 | — | — | — | |
| MADBase Model=VILLA, Training Protocol=Only Finetune, Teacher Visual Encoder=CLIP-V, Teacher Text Encoder=ROBERTa, Training Data Scale=0.3%2022.04 | 39.04 | — | — | — | |
| BaselineBase Model=CLIP-ViL, Training Protocol=Re-Pretrain, Training Data Scale=0.3%2022.04 | 39.01 | — | — | — | |
| MADBase Model=VILLA, Training Protocol=Only Finetune, Teacher Visual Encoder=ViT, Teacher Text Encoder=CLIP-T, Training Data Scale=0.3%2022.04 | 38.79 | — | — | — | |
| AdapterBase Model=VL-BERT, Training Protocol=Only Finetune, Teacher Visual Encoder=CLIP-V, Teacher Text Encoder=CLIP-T, Training Data Scale=3%2022.04 | 37.41 | — | — | — | |
| BaselineBase Model=VILLA, Training Protocol=Only Finetune, Training Data Scale=0.3%2022.04 | 37.18 | — | — | — | |
| MADBase Model=VL-BERT, Training Protocol=Only Finetune, Teacher Visual Encoder=CLIP-V, Teacher Text Encoder=CLIP-T, Training Data Scale=0.3%2022.04 | 37.12 | — | — | — | |
| MDBase Model=VL-BERT, Training Protocol=Only Finetune, Teacher Visual Encoder=CLIP-V, Teacher Text Encoder=CLIP-T, Training Data Scale=0.3%2022.04 | 36.83 | — | — | — | |
| BaselineBase Model=UNITER, Training Protocol=Only Finetune, Training Data Scale=0.3%2022.04 | 36.46 | — | — | — | |
| BaselineBase Model=VL-BERT, Training Protocol=Only Finetune, Training Data Scale=0.3%2022.04 | 35.33 | — | — | — | |
| Image-OnlyEvaluation Protocol=VQA-CE2021.04 | 24.39 | — | — | — | |
| AdapterBase Model=VL-BERT, Training Protocol=Only Finetune, Teacher Visual Encoder=CLIP-V, Teacher Text Encoder=CLIP-T, Training Data Scale=0.3%2022.04 | 16.14 | — | — | — |