Vision-centric Reasoning on CV Bench
83.8AccuracyLong Grounded Thoughts (SFT + GRPO)
Evaluation Results
| Method | Links | |
|---|---|---|
| Long Grounded Thoughts (SFT + GRPO)Open Model=Yes, Open Data=Yes, Base Model=Qwen2.5-VL-7B-Instruct2025.11 | 83.8 | |
| MiMo-VL-7B-RLOpen Model=Yes, Open Data=No2025.11 | 82.3 | |
| Long Grounded Thoughts (Multistage SFT + DPO)Open Model=Yes, Open Data=Yes, Base Model=Qwen2.5-VL-7B-Instruct2025.11 | 82.28 | |
| MiMo-VL-7B-SFTOpen Model=Yes, Open Data=No2025.11 | 81.8 | |
| Long Grounded Thoughts (SFT + DPO)Open Model=Yes, Open Data=Yes, Base Model=Qwen2.5-VL-7B-Instruct2025.11 | 81.51 | |
| Long Grounded Thoughts (SFT)Open Model=Yes, Open Data=Yes, Base Model=Qwen2.5-VL-7B-Instruct2025.11 | 80.6 | |
| GPT-4oOpen Model=No, Open Data=No2025.11 | 76 | |
| Claude 3.7Open Model=No, Open Data=No2025.11 | 75.4 | |
| Qwen2.5-VL-7B-Instruct + LongPerceptualThoughtsOpen Model=Yes, Open Data=Yes2025.11 | 75.3 | |
| Qwen2.5-VL-7B-InstructOpen Model=Yes, Open Data=No2025.11 | 74.52 | |
| Qwen2.5-VL-7B-Instruct + VLAA-ThinkerOpen Model=Yes, Open Data=Yes2025.11 | 72.95 | |
| Qwen2.5-VL-7B-Instruct + Revisual-R1-finalOpen Model=Yes, Open Data=Yes2025.11 | 72.77 |