Scene-Text Visual Question Answering on ST-VQA 1.0 (test)
71.8ANLSDocFormerv2-large
Evaluation Results
| Method | Links | |
|---|---|---|
| DocFormerv2-largepre-train data=64M, number of parameters=750M2023.06 | 71.8 | |
| LaTr-largepre-train data=64M, number of parameters=856M2023.06 | 69.6 | |
| GITpre-train data=800M (Proprietary), number of parameters=681M2023.06 | 69.6 | |
| LaTr-basepre-train data=64M, number of parameters=311M, training_set=ST-VQA + TextVQA2023.06 | 68.4 | |
| DocFormerv2-basepre-train data=64M, number of parameters=232M2023.06 | 68.4 | |
| LaTr-basepre-train data=64M, number of parameters=311M2023.06 | 66.8 | |
| PreSTUpre-train data=13M, number of parameters=237M2023.06 | 65.5 | |
| TAP + TAG2023.06 | 60.2 | |
| TAPpre-train data=200M2023.06 | 59.7 | |
| LOGOS2023.06 | 57.9 | |
| SceneGate2023.06 | 51.6 | |
| SA-M4Cpre-train data=200M2023.06 | 50.4 | |
| LaAP2023.06 | 48.5 | |
| M4Cpre-train data=200M2023.06 | 46.2 |