Visual Question Answering on OCR-VQA (val)
71.1AccuracyDocFormerv2_large
Evaluation Results
| Method | Links | |
|---|---|---|
| DocFormerv2_largepre-train data=64M, number of parameters=750M2023.06 | 71.1 | |
| GIT2Model Size=5.1B2022.05 | 69.9 | |
| DocFormerv2_basepre-train data=64M, number of parameters=232M2023.06 | 69.7 | |
| GITpre-train data=800M, number of parameters=681M2023.06 | 67.8 | |
| GITModel Size=0.7B2022.05 | 67.8 | |
| LaTr-BaseOCR System=Rosetta OCR, Pre-training Dataset=IDL, Setting=Constrained2021.12 | 67.5 | |
| LaTr_basepre-train data=64M, number of parameters=311M2023.06 | 67.5 | |
| LaTr2022.05 | 67.5 | |
| LaAP2023.06 | 63.8 | |
| LaAP-Net2022.05 | 63.8 | |
| M4COCR System=Rosetta OCR, Setting=Constrained2021.12 | 63.5 | |
| M4Cnumber of parameters=200M2023.06 | 63.5 | |
| M4C2022.05 | 63.5 | |
| GIT_largepre-train data=20M, number of parameters=347M2023.06 | 62.4 | |
| GIT_LModel Size=0.3B2022.05 | 62.4 | |
| GIT_basepre-train data=10M, number of parameters=129M2023.06 | 57.3 | |
| GIT_BModel Size=0.1B2022.05 | 57.3 |