Object Visual Question Answering (Multiple Choice) on RIO-Bench Obj-VQA (MC) Clean
98.4AccuracyIT-RT
Evaluation Results
| Method | Links | |
|---|---|---|
| IT-RTBackbone=Qwen-2.5-VL-7B, Category=text-agnostic2025.12 | 98.4 | |
| IT-RTBackbone=Qwen2.5-VL-7B, Training Strategy=IT-RT2025.12 | 98.4 | |
| RIO-RTBackbone=Qwen-3-VL-7B, Category=selective2025.12 | 98.1 | |
| IT-RTBackbone=Llama-3.2-Vision-11B, Category=text-agnostic2025.12 | 98.1 | |
| IT-RTBackbone=Llama-3.2-11B-Vision, Training Strategy=IT-RT2025.12 | 98.1 | |
| RIO-RTBackbone=Qwen-2.5-VL-7B, Category=selective2025.12 | 98 | |
| RIO-RTBackbone=Qwen2.5-VL-7B, Training Strategy=RIO-RT2025.12 | 98 | |
| IT-RTBackbone=Qwen-3-VL-7B, Category=text-agnostic2025.12 | 97.9 | |
| IT-RTBackbone=Llava-1.5-7B, Category=text-agnostic2025.12 | 97.6 | |
| RIO-RTBackbone=Llama-3.2-Vision-11B, Category=selective2025.12 | 97.6 | |
| IT-RTBackbone=LLaVA-1.5-7B, Training Strategy=IT-RT2025.12 | 97.6 | |
| RIO-RTBackbone=Llama-3.2-11B-Vision, Training Strategy=RIO-RT2025.12 | 97.6 | |
| RIO-RTBackbone=Llava-1.5-7B, Category=selective2025.12 | 97.4 | |
| RIO-RTBackbone=LLaVA-1.5-7B, Training Strategy=RIO-RT2025.12 | 97.4 | |
| RIO-RTBackbone=Llava-1.5-13B, Category=selective2025.12 | 97.2 | |
| RIO-RTBackbone=LLaVA-1.5-13B, Training Strategy=RIO-RT2025.12 | 97.2 | |
| pretrainedBackbone=Qwen-2.5-VL-7B2025.12 | 96.9 | |
| pretrainedBackbone=Qwen2.5-VL-7B, Training Strategy=pretrained2025.12 | 96.9 | |
| IT-RTBackbone=Llava-1.5-13B, Category=text-agnostic2025.12 | 96.8 | |
| IT-RTBackbone=LLaVA-1.5-13B, Training Strategy=IT-RT2025.12 | 96.8 | |
| CoT-defenseBackbone=Qwen-2.5-VL-7B, Category=text-agnostic2025.12 | 96.6 | |
| CoTBackbone=Qwen2.5-VL-7B, Training Strategy=CoT2025.12 | 96.6 | |
| CoT-defenseBackbone=Qwen-3-VL-7B, Category=text-agnostic2025.12 | 96.2 | |
| pretrainedBackbone=Qwen-3-VL-7B2025.12 | 96.1 | |
| RIO-RTBackbone=SmolVLM-2B, Category=selective2025.12 | 96 | |
| pretrainedBackbone=Llama-3.2-Vision-11B2025.12 | 95.5 | |
| pretrainedBackbone=Llama-3.2-11B-Vision, Training Strategy=pretrained2025.12 | 95.5 | |
| IT-RTBackbone=SmolVLM-2B, Category=text-agnostic2025.12 | 94.7 | |
| CoT-defenseBackbone=Llava-1.5-13B, Category=text-agnostic2025.12 | 94.6 | |
| CoTBackbone=LLaVA-1.5-13B, Training Strategy=CoT2025.12 | 94.6 | |
| pretrainedBackbone=Llava-1.5-7B2025.12 | 93.5 | |
| pretrainedBackbone=LLaVA-1.5-7B, Training Strategy=pretrained2025.12 | 93.5 | |
| CoT-defenseBackbone=Llama-3.2-Vision-11B, Category=text-agnostic2025.12 | 93 | |
| CoTBackbone=Llama-3.2-11B-Vision, Training Strategy=CoT2025.12 | 93 | |
| pretrainedBackbone=Llava-1.5-13B2025.12 | 92.5 | |
| pretrainedBackbone=LLaVA-1.5-13B, Training Strategy=pretrained2025.12 | 92.5 | |
| pretrainedBackbone=SmolVLM-2B2025.12 | 92.1 | |
| CoT-defenseBackbone=SmolVLM-2B, Category=text-agnostic2025.12 | 92.1 | |
| CoT-defenseBackbone=Llava-1.5-7B, Category=text-agnostic2025.12 | 86.1 | |
| CoTBackbone=LLaVA-1.5-7B, Training Strategy=CoT2025.12 | 86.1 |