Scene-Text Visual Question Answering on ST-VQA 1.0 (val)
72.9ANLSDocFormerv2-large
Evaluation Results
| Method | Links | |
|---|---|---|
| DocFormerv2-largepre-train data=64M, number of parameters=750M2023.06 | 72.9 | |
| LaTr-largepre-train data=64M, number of parameters=856M2023.06 | 70.2 | |
| DocFormerv2-basepre-train data=64M, number of parameters=232M2023.06 | 70.1 | |
| GITpre-train data=800M (Proprietary), number of parameters=681M2023.06 | 69.1 | |
| LaTr-basepre-train data=64M, number of parameters=311M, training_set=ST-VQA + TextVQA2023.06 | 68.3 | |
| LaTr-basepre-train data=64M, number of parameters=311M2023.06 | 67.5 | |
| TAP + TAG2023.06 | 62 | |
| TAPpre-train data=200M2023.06 | 59.8 | |
| LOGOS2023.06 | 58.1 | |
| SceneGate2023.06 | 52.5 | |
| SA-M4Cpre-train data=200M2023.06 | 51.2 | |
| LaAP2023.06 | 49.7 | |
| M4Cpre-train data=200M2023.06 | 47.2 | |
| GIT-largepre-train data=20M (Proprietary), number of parameters=347M2023.06 | 44.6 | |
| GIT-basepre-train data=10M (Proprietary), number of parameters=129M2023.06 | 20.7 |