Visual Question Answering on TextVQA (Accuracy Single/Multi)
75.9Accuracy (Single)CoCoT (Qwen)
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| CoCoT (Qwen)Backbone=Qwen2-VL 7B, Training samples=02026.01 | 75.9 | 71.5 | |
| VisCoT (Qwen)Backbone=Qwen2-VL 7B, Training samples=02026.01 | 71.9 | 68.2 | |
| Qwen2-VLBackbone=Qwen2-VL 7B, Training samples=02026.01 | 71.3 | 70.2 | |
| CoCoT* (LLaVA)Backbone=LLaVA-1.5 7B, Training samples=14k, Trained on annotated data=true2026.01 | 53.3 | 35.1 | |
| VisCoT* (LLaVA)Backbone=LLaVA-1.5 7B, Training samples=363k, Trained on annotated data=true2026.01 | 51.9 | 39.7 | |
| CoCoT (LLaVA)Backbone=LLaVA-1.5 7B, Training samples=02026.01 | 47.6 | 43.7 | |
| LLaVA-1.5Backbone=LLaVA-1.5 7B, Training samples=02026.01 | 13.5 | 14.6 |