Scene Text-centric Visual Question Answering on AI2D
76.1AccuracyDeFacto
Evaluation Results
| Method | Links | |
|---|---|---|
| DeFactoBackbone=Qwen2.5-VL-7B2025.09 | 76.1 | |
| GRITBackbone=Qwen2.5-VL-3B2025.09 | 75.5 | |
| Qwen2.5-VLBackbone=Qwen2.5-VL-7B2025.09 | 69.5 | |
| Visual-SR1Backbone=Qwen2.5-VL-7B2025.09 | 69 | |
| ViCropBackbone=LLaVA-1.5 (Vicuna-7B)2025.09 | 68.8 | |
| DeepEyesBackbone=Qwen2.5-VL-7B2025.09 | 37 |