Text Visual Question Answering (Open Ended) on RIO-Bench Text-VQA (OE) Clean
84.6Accuracypretrained
Evaluation Results
| Method | Links | |
|---|---|---|
| pretrainedBackbone=Qwen-2.5-VL-7B2025.12 | 84.6 | |
| pretrainedBackbone=Qwen2.5-VL-7B, Training Strategy=pretrained2025.12 | 84.6 | |
| RIO-RTBackbone=Qwen-2.5-VL-7B, Category=selective2025.12 | 84.3 | |
| RIO-RTBackbone=Qwen2.5-VL-7B, Training Strategy=RIO-RT2025.12 | 84.3 | |
| RIO-RTBackbone=Qwen-3-VL-7B, Category=selective2025.12 | 84.1 | |
| pretrainedBackbone=Qwen-3-VL-7B2025.12 | 84 | |
| RIO-RTBackbone=Llama-3.2-Vision-11B, Category=selective2025.12 | 81.3 | |
| RIO-RTBackbone=Llama-3.2-11B-Vision, Training Strategy=RIO-RT2025.12 | 81.3 | |
| IT-RTBackbone=Qwen-2.5-VL-7B, Category=text-agnostic2025.12 | 80.9 | |
| IT-RTBackbone=Qwen2.5-VL-7B, Training Strategy=IT-RT2025.12 | 80.9 | |
| pretrainedBackbone=SmolVLM-2B2025.12 | 72.3 | |
| CoT-defenseBackbone=Qwen-3-VL-7B, Category=text-agnostic2025.12 | 72.1 | |
| CoT-defenseBackbone=Qwen-2.5-VL-7B, Category=text-agnostic2025.12 | 71.4 | |
| CoTBackbone=Qwen2.5-VL-7B, Training Strategy=CoT2025.12 | 71.4 | |
| CoT-defenseBackbone=SmolVLM-2B, Category=text-agnostic2025.12 | 71.1 | |
| CoT-defenseBackbone=Llama-3.2-Vision-11B, Category=text-agnostic2025.12 | 70 | |
| CoTBackbone=Llama-3.2-11B-Vision, Training Strategy=CoT2025.12 | 70 | |
| RIO-RTBackbone=SmolVLM-2B, Category=selective2025.12 | 68.9 | |
| IT-RTBackbone=Qwen-3-VL-7B, Category=text-agnostic2025.12 | 68.5 | |
| pretrainedBackbone=Llama-3.2-Vision-11B2025.12 | 65.5 | |
| pretrainedBackbone=Llama-3.2-11B-Vision, Training Strategy=pretrained2025.12 | 65.5 | |
| IT-RTBackbone=Llama-3.2-Vision-11B, Category=text-agnostic2025.12 | 58.5 | |
| IT-RTBackbone=Llama-3.2-11B-Vision, Training Strategy=IT-RT2025.12 | 58.5 | |
| pretrainedBackbone=Llava-1.5-13B2025.12 | 54.5 | |
| pretrainedBackbone=LLaVA-1.5-13B, Training Strategy=pretrained2025.12 | 54.5 | |
| RIO-RTBackbone=Llava-1.5-7B, Category=selective2025.12 | 53.3 | |
| RIO-RTBackbone=LLaVA-1.5-7B, Training Strategy=RIO-RT2025.12 | 53.3 | |
| RIO-RTBackbone=Llava-1.5-13B, Category=selective2025.12 | 53.2 | |
| RIO-RTBackbone=LLaVA-1.5-13B, Training Strategy=RIO-RT2025.12 | 53.2 | |
| CoT-defenseBackbone=Llava-1.5-13B, Category=text-agnostic2025.12 | 50.5 | |
| CoTBackbone=LLaVA-1.5-13B, Training Strategy=CoT2025.12 | 50.5 | |
| pretrainedBackbone=Llava-1.5-7B2025.12 | 49.5 | |
| pretrainedBackbone=LLaVA-1.5-7B, Training Strategy=pretrained2025.12 | 49.5 | |
| CoT-defenseBackbone=Llava-1.5-7B, Category=text-agnostic2025.12 | 46.1 | |
| CoTBackbone=LLaVA-1.5-7B, Training Strategy=CoT2025.12 | 46.1 | |
| IT-RTBackbone=SmolVLM-2B, Category=text-agnostic2025.12 | 35.4 | |
| IT-RTBackbone=Llava-1.5-7B, Category=text-agnostic2025.12 | 30.3 | |
| IT-RTBackbone=LLaVA-1.5-7B, Training Strategy=IT-RT2025.12 | 30.3 | |
| IT-RTBackbone=Llava-1.5-13B, Category=text-agnostic2025.12 | 15.3 | |
| IT-RTBackbone=LLaVA-1.5-13B, Training Strategy=IT-RT2025.12 | 15.3 |