Visual Question Answering on countbenchqa
93.2AccuracyRLR³
Evaluation Results
| Method | Links | |
|---|---|---|
| RLR³Training Source=ViRL2026.05 | 93.2 | |
| RLR³Training Source=DeepVision2026.05 | 92.6 | |
| Cont-Squeeze (128 -> 1)Optimization steps=+200 steps2026.02 | 92.59 | |
| In-Squeeze (128 ... -> 1)Optimization mode=Min steps2026.02 | 92.59 | |
| Cont-Squeeze (128 -> 1)Optimization steps=+700 steps2026.02 | 92.49 | |
| In-Squeeze (128 ... -> 1)Optimization mode=Standard2026.02 | 92.22 | |
| Direct Fine-tuning (r=1)Optimization steps=+700 steps2026.02 | 91.94 | |
| Direct Fine-tuning (r=1)Optimization steps=+0 steps2026.02 | 91.84 | |
| Direct Fine-tuning (r=1)Optimization steps=+200 steps2026.02 | 91.47 | |
| Cont-Squeeze (128 -> 1)Optimization steps=+0 steps2026.02 | 91.2 | |
| GPT-5 miniVersion=high2026.05 | 91 | |
| RLR³Training Source=OpenMMR2026.05 | 90.3 | |
| Official thinkingSource=Qwen3-VL2026.05 | 90 | |
| Official instructSource=Qwen3-VL2026.05 | 89.8 | |
| RLVRTraining Source=OpenMMR2026.05 | 89.7 | |
| Base instruct2026.05 | 88.7 | |
| Gemini-2.0-FlashModel Category=Proprietary2025.12 | 88.6 | |
| RLVRTraining Source=DeepVision2026.05 | 88.3 | |
| Gemma 3 4B ITZero-shot=true2026.02 | 87.4 | |
| RLVRTraining Source=ViRL2026.05 | 87.3 | |
| GPT-4oModel Category=Proprietary2025.12 | 84.7 | |
| GPT-5 miniVersion=minimal2026.05 | 84.1 | |
| Qwen2.5-VL-7BModel Category=Open-Source2025.12 | 82.5 | |
| Claude-3.5-HaikuModel Category=Proprietary2025.12 | 77.6 | |
| MRoPEPositional Encoding Method=MRoPE, DIPE Enhancement=+DIPE2026.03 | 75.97 | |
| VALORBase Model=Qwen3-8B2025.12 | 75.9 | |
| VALORModel Category=Open-Source2025.12 | 75.9 | |
| Vanilla RoPEPositional Encoding Method=Vanilla RoPE, DIPE Enhancement=+DIPE2026.03 | 75.15 | |
| MRoPE-IPositional Encoding Method=MRoPE-I, DIPE Enhancement=+DIPE2026.03 | 74.95 | |
| ViGoRLBase Model=Qwen2.5-VL-7B2025.12 | 74.5 | |
| Llama3.2-11BModel Category=Open-Source2025.12 | 71.5 | |
| Vanilla RoPEPositional Encoding Method=Vanilla RoPE, DIPE Enhancement=Base2026.03 | 70.26 | |
| GRITBase Model=Qwen2.5-VL-3B2025.12 | 68.6 | |
| MRoPE-IPositional Encoding Method=MRoPE-I, DIPE Enhancement=Base2026.03 | 67.62 | |
| VALOR-RLBase Model=Qwen3-8B2025.12 | 67.6 | |
| VALOR-RLModel Category=Open-Source2025.12 | 67.6 | |
| MRoPEPositional Encoding Method=MRoPE, DIPE Enhancement=Base2026.03 | 66.6 |