Object Visual Question Answering (Open Ended) on RIO-Bench Obj-VQA (OE) Clean
62.2AccuracyIT-RT
Evaluation Results
| Method | Links | |
|---|---|---|
| IT-RTBackbone=Llama-3.2-Vision-11B, Category=text-agnostic2025.12 | 62.2 | |
| RIO-RTBackbone=Qwen-2.5-VL-7B, Category=selective2025.12 | 61.5 | |
| RIO-RTBackbone=Llama-3.2-Vision-11B, Category=selective2025.12 | 61.5 | |
| IT-RTBackbone=Qwen-2.5-VL-7B, Category=text-agnostic2025.12 | 61.3 | |
| IT-RTBackbone=Qwen-3-VL-7B, Category=text-agnostic2025.12 | 61.1 | |
| IT-RTBackbone=Llava-1.5-7B, Category=text-agnostic2025.12 | 60.9 | |
| RIO-RTBackbone=Llava-1.5-7B, Category=selective2025.12 | 60.5 | |
| IT-RTBackbone=Llava-1.5-13B, Category=text-agnostic2025.12 | 60.1 | |
| RIO-RTBackbone=Qwen-3-VL-7B, Category=selective2025.12 | 60 | |
| CoT-defenseBackbone=Qwen-3-VL-7B, Category=text-agnostic2025.12 | 59.8 | |
| CoT-defenseBackbone=Llama-3.2-Vision-11B, Category=text-agnostic2025.12 | 59.8 | |
| pretrainedBackbone=Qwen-2.5-VL-7B2025.12 | 59.6 | |
| RIO-RTBackbone=Llava-1.5-13B, Category=selective2025.12 | 59.3 | |
| CoT-defenseBackbone=Qwen-2.5-VL-7B, Category=text-agnostic2025.12 | 59 | |
| pretrainedBackbone=Qwen-3-VL-7B2025.12 | 58.7 | |
| CoT-defenseBackbone=Llava-1.5-13B, Category=text-agnostic2025.12 | 58.5 | |
| IT-RTBackbone=SmolVLM-2B, Category=text-agnostic2025.12 | 58.1 | |
| RIO-RTBackbone=SmolVLM-2B, Category=selective2025.12 | 58.1 | |
| CoT-defenseBackbone=Llava-1.5-7B, Category=text-agnostic2025.12 | 57.8 | |
| pretrainedBackbone=Llama-3.2-Vision-11B2025.12 | 57.6 | |
| pretrainedBackbone=Llava-1.5-13B2025.12 | 56.5 | |
| pretrainedBackbone=Llava-1.5-7B2025.12 | 56 | |
| pretrainedBackbone=SmolVLM-2B2025.12 | 53.7 | |
| CoT-defenseBackbone=SmolVLM-2B, Category=text-agnostic2025.12 | 49.2 |