Scene Text-Centric Visual Question Answering on STVQA
0.759AccuracyVisual-SR1
Evaluation Results
| Method | Links | |
|---|---|---|
| Visual-SR1Backbone=Qwen2.5-VL-7B2025.09 | 0.759 | |
| ViCropBackbone=LLaVA-1.5 (Vicuna-7B)2025.09 | 0.724 | |
| DeFactoBackbone=Qwen2.5-VL-7B2025.09 | 0.712 | |
| Qwen2.5-VLBackbone=Qwen2.5-VL-7B2025.09 | 0.679 | |
| GRITBackbone=Qwen2.5-VL-3B2025.09 | 0.647 | |
| InternVLModel Generation Capability=Text only2024.07 | 0.622 | |
| InternLM-XComposer2Model Generation Capability=Text only2024.07 | 0.596 | |
| MonkeyModel Generation Capability=Text only2024.07 | 0.547 | |
| TextHarmony-ChatModel Generation Capability=Text and image, Slide-LoRA=true2024.07 | 0.513 | |
| mPLUG-Owl2Model Generation Capability=Text only2024.07 | 0.498 | |
| TextHarmonyModel Generation Capability=Text and image, Slide-LoRA=true2024.07 | 0.497 | |
| TextHarmony*Model Generation Capability=Text and image, Slide-LoRA=false2024.07 | 0.472 | |
| DeepEyesBackbone=Qwen2.5-VL-7B2025.09 | 0.459 | |
| DocPediaModel Generation Capability=Text only2024.07 | 0.455 | |
| LLaVARModel Generation Capability=Text only2024.07 | 0.392 | |
| LLaVA1.5-7BModel Generation Capability=Text only2024.07 | 0.381 | |
| UniDocModel Generation Capability=Text only2024.07 | 0.352 | |
| MM-InterleavedModel Generation Capability=Text and image2024.07 | 0.264 | |
| SEED-LLaMA-14BModel Generation Capability=Text and image2024.07 | 0.201 | |
| MiniGPT5Model Generation Capability=Text and image2024.07 | 0.024 |