Visual Reasoning on HallusionBench
73.2AccuracyGSPO + DyCo-RL
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| GSPO + DyCo-RLModel Scale=Qwen2.5-VL-7B2026.06 | 73.2 | — | |
| GRPO + DyCo-RLModel Scale=Qwen2.5-VL-7B2026.06 | 71.6 | — | |
| GSPOModel Scale=Qwen2.5-VL-7B2026.06 | 71.4 | — | |
| DAPO + DyCo-RLModel Scale=Qwen2.5-VL-7B2026.06 | 71 | — | |
| SAPOModel Scale=Qwen2.5-VL-7B2026.06 | 71 | — | |
| DAPOModel Scale=Qwen2.5-VL-7B2026.06 | 70 | — | |
| GRPOModel Scale=Qwen2.5-VL-7B2026.06 | 69.2 | — | |
| SAPO + DyCo-RLModel Scale=Qwen2.5-VL-7B2026.06 | 69.2 | — | |
| OursModel=Kimi-VL A3B-Thinking2025.10 | 68.19 | 68.32 | |
| VCDModel=Kimi-VL A3B-Thinking2025.10 | 65.68 | 67.91 | |
| GPT5Model Category=Proprietary Model2026.07 | 65.2 | — | |
| Zero-ShotModel Scale=Qwen2.5-VL-7B2026.06 | 65 | — | |
| VanillaModel=Kimi-VL A3B-Thinking2025.10 | 64.76 | 64.97 | |
| Gemini-2.5-ProModel Category=Proprietary Model2026.07 | 64.1 | — | |
| SAPO + DyCo-RLModel Scale=Qwen2.5-VL-3B2026.06 | 63.9 | — | |
| DAPO + DyCo-RLModel Scale=Qwen2.5-VL-3B2026.06 | 62.7 | — | |
| GRPO + DyCo-RLModel Scale=Qwen2.5-VL-3B2026.06 | 62.4 | — | |
| GSPOModel Scale=Qwen2.5-VL-3B2026.06 | 62.4 | — | |
| GSPO + DyCo-RLModel Scale=Qwen2.5-VL-3B2026.06 | 62 | — | |
| AGLAModel=Kimi-VL A3B-Thinking2025.10 | 61.36 | 63.51 | |
| Zero-ShotModel Scale=Qwen2.5-VL-3B2026.06 | 61.3 | — | |
| GRPOModel Scale=Qwen2.5-VL-3B2026.06 | 60.8 | — | |
| OursModel=R1-Onevision 7B2025.10 | 60.77 | 60.88 | |
| DAPOModel Scale=Qwen2.5-VL-3B2026.06 | 60.7 | — | |
| LASERModel Category=Open-source Vision-Language Model2026.07 | 60.7 | — | |
| SAPOModel Scale=Qwen2.5-VL-3B2026.06 | 59.7 | — | |
| VCDModel=R1-Onevision 7B2025.10 | 58.96 | 59.03 | |
| VanillaModel=R1-Onevision 7B2025.10 | 58.26 | 58.49 | |
| VAPO-Thinker-7BModel Category=Open-source Vision-Language Model2026.07 | 57.4 | — | |
| AGLAModel=R1-Onevision 7B2025.10 | 55.69 | 55.75 | |
| Reflection-V-7BModel Category=Open-source Vision-Language Model2026.07 | 53.9 | — | |
| OursModel=Ocean-R1 7B Instruct2025.10 | 53.64 | 53.77 | |
| Qwen2.5-VL-7BModel Category=Open-source Vision-Language Model2026.07 | 53.6 | — | |
| R1-Onevision-7BModel Category=Open-source Vision-Language Model2026.07 | 52.5 | — | |
| OpenVLThinker-7BModel Category=Open-source Vision-Language Model2026.07 | 52.2 | — | |
| CGDModel=Kimi-VL A3B-Thinking2025.10 | 52.13 | 55.73 | |
| VCDModel=Ocean-R1 7B Instruct2025.10 | 50.57 | 50.66 | |
| VisionR1-7BModel Category=Open-source Vision-Language Model2026.07 | 49.5 | — | |
| VanillaModel=Ocean-R1 7B Instruct2025.10 | 49.41 | 49.45 | |
| InternVL2.5-8BModel Category=Open-source Vision-Language Model2026.07 | 49 | — | |
| CGDModel=R1-Onevision 7B2025.10 | 48.89 | 48.82 | |
| AGLAModel=Ocean-R1 7B Instruct2025.10 | 45.2 | 45.07 | |
| CGDModel=Ocean-R1 7B Instruct2025.10 | 33.72 | 33.34 |