Multimodal mathematical reasoning on MathVision
61.5Pass@1 AccuracyGPT-5
Evaluation Results
| Method | Links | |
|---|---|---|
| GPT-5Model Type=Closed-Source2026.05 | 61.5 | |
| GPT-5-Nano-HighModel Category=Closed-source Models2026.02 | 58.75 | |
| Qwen3-VL-8B-ThinkingSeries=Qwen3-VL-8B2026.02 | 57.89 | |
| Qwen3-VL-8B-DeepVisionSeries=Qwen3-VL-8B, Training Algorithm=GSPO2026.02 | 55.49 | |
| MiMo-VL-7B-DeepVisionSeries=MiMo-VL-7B, Training Algorithm=GSPO2026.02 | 55.24 | |
| MiMo-VL-7B-RL-2508Series=MiMo-VL-7B2026.02 | 53.91 | |
| Kimi-K2.5Model Type=Open-Source & Baselines2026.05 | 53.3 | |
| MiMo-VL-7B-OpenMMReasonerSeries=MiMo-VL-7B2026.02 | 52.97 | |
| Gemini-2.5-Flash-LiteModel Category=Closed-source Models2026.02 | 52.47 | |
| Qwen3-VL-8B-InstructSeries=Qwen3-VL-8B2026.02 | 51.44 | |
| MiMo-VL-7B-MathBookSeries=MiMo-VL-7B2026.02 | 51.31 | |
| MiMo-VL-7B-SFT-2508Series=MiMo-VL-7B2026.02 | 50.69 | |
| MiMo-VL-7B-MM-EurekaSeries=MiMo-VL-7B2026.02 | 50 | |
| Qwen3-VL-32BModel Type=Open-Source & Baselines2026.05 | 45.4 | |
| MAESTROModel Type=Ours2026.05 | 43.4 | |
| Gemini-2.5-FlashModel Type=Closed-Source2026.05 | 39.8 | |
| Gemini-2.5-ProModel Type=Closed-Source2026.05 | 39.8 | |
| GLM-4.6VModel Type=Open-Source & Baselines2026.05 | 39.1 | |
| GPT-4oModel Type=Closed-Source2026.05 | 30.4 | |
| VTOOL-R1Model Type=Think with Images Methods2026.05 | 29.3 | |
| Untrained ModelModel Type=Open-Source & Baselines2026.05 | 29 | |
| DeepEyes-v2Model Type=Think with Images Methods2026.05 | 28.9 | |
| ThymeModel Type=Think with Images Methods2026.05 | 27.6 | |
| VTS-VModel Type=Think with Images Methods2026.05 | 27 | |
| DeepEyesModel Type=Think with Images Methods2026.05 | 26.6 | |
| MathCoder-VLModel Type=Think with Images Methods2026.05 | 26 | |
| Direct AnsweringModel Type=Open-Source & Baselines2026.05 | 24.9 | |
| PixelReasonerModel Type=Think with Images Methods2026.05 | 23.4 | |
| VisionReasonerModel Type=Think with Images Methods2026.05 | 21.7 | |
| Visual-ARFTModel Type=Think with Images Methods2026.05 | 21.4 | |
| Chain-of-FocusModel Type=Think with Images Methods2026.05 | 21.1 |