Visual Reasoning on Multi-source Average (test)
86.3Union ScoreChain-of-Thought
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| Chain-of-ThoughtTraining Strategy=Supervised Post-Training2026.05 | 86.3 | 78.2 | |
| SFTTraining Strategy=Supervised Post-Training2026.05 | 86.2 | 76.4 | |
| DAPO+OursTraining Strategy=Reinforcement Post-Training2026.05 | 85.2 | 80.7 | |
| GRPO+OursTraining Strategy=Reinforcement Post-Training2026.05 | 84.7 | 77.9 | |
| GRPOTraining Strategy=Reinforcement Post-Training2026.05 | 83.6 | 74.7 | |
| DAPOTraining Strategy=Reinforcement Post-Training2026.05 | 83 | 75.8 | |
| VisionReasoner-7BTraining Strategy=Previous Methods2026.05 | 78.6 | 67.2 | |
| Qwen2.5-VL-3BTraining Strategy=Previous Methods2026.05 | 75.1 | 59.4 | |
| R1-Onevision-7BTraining Strategy=Previous Methods2026.05 | 68.5 | 55.6 | |
| LLaVA-OV-7BTraining Strategy=Previous Methods2026.05 | 63.5 | 42.3 |