Open-Ended Text-centric VQA Aggregation (AI2D, ChartQA, DocVQA, InfoVQA)
82.9AI2D Accuracypretrained
Evaluation Results
| Method | Links | |||||
|---|---|---|---|---|---|---|
| pretrainedBackbone=Qwen2.5-VL-7B, Training Strategy=pretrained2025.12 | 82.9 | 83 | 94.4 | 80.2 | 85.1 | |
| RIO-RTBackbone=Qwen2.5-VL-7B, Training Strategy=RIO-RT2025.12 | 81.2 | 84.6 | 94 | 78.9 | 84.7 | |
| CoTBackbone=Qwen2.5-VL-7B, Training Strategy=CoT2025.12 | 78.7 | 56.7 | 56.7 | 56.3 | 62.1 | |
| IT-RTBackbone=Qwen2.5-VL-7B, Training Strategy=IT-RT2025.12 | 76.4 | 67.1 | 91.1 | 75.9 | 77.6 | |
| IT-RTBackbone=Llama-3.2-11B-Vision, Training Strategy=IT-RT2025.12 | 70.1 | 52.2 | 75.7 | 59.7 | 64.5 | |
| RIO-RTBackbone=Llama-3.2-11B-Vision, Training Strategy=RIO-RT2025.12 | 67.8 | 68.8 | 89.6 | 65.4 | 72.9 | |
| pretrainedBackbone=LLaVA-1.5-13B, Training Strategy=pretrained2025.12 | 57.6 | 19.1 | 27.8 | 26.2 | 32.7 | |
| RIO-RTBackbone=LLaVA-1.5-13B, Training Strategy=RIO-RT2025.12 | 55.1 | 17.5 | 24.5 | 23.6 | 30.2 | |
| pretrainedBackbone=LLaVA-1.5-7B, Training Strategy=pretrained2025.12 | 52.5 | 17.9 | 23.8 | 21.7 | 29 | |
| RIO-RTBackbone=LLaVA-1.5-7B, Training Strategy=RIO-RT2025.12 | 51.5 | 17.7 | 27 | 22.4 | 29.7 | |
| CoTBackbone=LLaVA-1.5-7B, Training Strategy=CoT2025.12 | 50.6 | 17.5 | 23.5 | 21.6 | 28.3 | |
| IT-RTBackbone=LLaVA-1.5-13B, Training Strategy=IT-RT2025.12 | 48.9 | 8.4 | 5.1 | 13.9 | 19.1 | |
| IT-RTBackbone=LLaVA-1.5-7B, Training Strategy=IT-RT2025.12 | 46.3 | 12.9 | 12.2 | 15.9 | 21.8 | |
| pretrainedBackbone=Llama-3.2-11B-Vision, Training Strategy=pretrained2025.12 | 46.3 | 29.7 | 81.3 | 57 | 53.6 | |
| CoTBackbone=LLaVA-1.5-13B, Training Strategy=CoT2025.12 | 27.8 | 18.7 | 27.2 | 25.2 | 24.7 | |
| CoTBackbone=Llama-3.2-11B-Vision, Training Strategy=CoT2025.12 | 9.7 | 26.7 | 78.1 | 43 | 39.4 |