Vision-centric Reasoning on MMStar-V
68.4AccuracyLong Grounded Thoughts (SFT + GRPO)
Evaluation Results
| Method | Links | |
|---|---|---|
| Long Grounded Thoughts (SFT + GRPO)Open Model=Yes, Open Data=Yes, Base Model=Qwen2.5-VL-7B-Instruct2025.11 | 68.4 | |
| MiMo-VL-7B-SFTOpen Model=Yes, Open Data=No2025.11 | 67.6 | |
| MiMo-VL-7B-RLOpen Model=Yes, Open Data=No2025.11 | 67.07 | |
| Long Grounded Thoughts (Multistage SFT + DPO)Open Model=Yes, Open Data=Yes, Base Model=Qwen2.5-VL-7B-Instruct2025.11 | 66.27 | |
| Qwen2.5-VL-7B-InstructOpen Model=Yes, Open Data=No2025.11 | 65.6 | |
| Long Grounded Thoughts (SFT + DPO)Open Model=Yes, Open Data=Yes, Base Model=Qwen2.5-VL-7B-Instruct2025.11 | 64.4 | |
| Long Grounded Thoughts (SFT)Open Model=Yes, Open Data=Yes, Base Model=Qwen2.5-VL-7B-Instruct2025.11 | 64.27 | |
| Qwen2.5-VL-7B-Instruct + LongPerceptualThoughtsOpen Model=Yes, Open Data=Yes2025.11 | 64.13 | |
| Qwen2.5-VL-7B-Instruct + VLAA-ThinkerOpen Model=Yes, Open Data=Yes2025.11 | 63.07 | |
| Qwen2.5-VL-7B-Instruct + Revisual-R1-finalOpen Model=Yes, Open Data=Yes2025.11 | 60.8 |