Mathematical Reasoning on MMATH
78.4Accuracyself-cons (ours)
Evaluation Results
| Method | Links | |
|---|---|---|
| self-cons (ours)Model Size=14B2026.05 | 78.4 | |
| S1Model Size=14B2026.05 | 77.4 | |
| S1Model Size=7B2026.05 | 74.7 | |
| self-cons (ours)Model Size=7B2026.05 | 74.3 | |
| baseModel Size=14B2026.05 | 72.2 | |
| baseModel Size=7B2026.05 | 71.1 | |
| LIDRModel Size=14B2026.05 | 70.5 | |
| LIDRModel Size=7B2026.05 | 67 | |
| GRPO-TransTestModel=Qwen2026.03 | 57.63 | |
| TAPO-ChrF++Model=Qwen2026.03 | 56.77 | |
| GRPO-EnCoTModel=Qwen2026.03 | 55.85 | |
| QwenModel=Qwen2026.03 | 54.25 | |
| S1Model Size=1.5B2026.05 | 53.8 | |
| self-cons (ours)Model Size=1.5B2026.05 | 48.8 | |
| baseModel Size=1.5B2026.05 | 46.9 | |
| LIDRModel Size=1.5B2026.05 | 45 | |
| TAPO-ChrF++Model=Llama2026.03 | 43.78 | |
| GRPO-TransTestModel=Llama2026.03 | 42.34 | |
| GRPO-EnCoTModel=Llama2026.03 | 42.22 | |
| V-STARData Size=40k2026.04 | 41.1 | |
| Vision-R1Data Size=210k2026.04 | 40.2 | |
| Vision-R1Paradigm=Tool-use & RL Enhanced Reasoning, Data Size=200K2026.04 | 40.2 | |
| SCF-VRParadigm=Latent Reasoning, Data Size=30K, Backbone=Qwen2.5-VL-7B2026.04 | 39.82 | |
| OpenVLThinkerData Size=59.2k2026.04 | 38.9 | |
| DMLRParadigm=Latent Reasoning, Data Size=-2026.04 | 38.8 | |
| ThinkLite-VLData Size=11k2026.04 | 38.4 | |
| Qwen2.5-VL-7BParadigm=Zero-Shot VLMs, Data Size=-2026.04 | 37.5 | |
| ICoTParadigm=Explicit CoT Reasoning, Data Size=-2026.04 | 37 | |
| CCoTParadigm=Explicit CoT Reasoning, Data Size=-2026.04 | 36.3 | |
| VL-CogitoData Size=80k2026.04 | 35.7 | |
| Multimodal CoTParadigm=Explicit CoT Reasoning, Data Size=-2026.04 | 35.6 | |
| VL-RethinkerData Size=39k2026.04 | 35.3 | |
| Qwen2.5VL2026.04 | 33.7 | |
| R1-OnevisionData Size=155k2026.04 | 32.1 | |
| GPT-4oParadigm=Zero-Shot VLMs, Data Size=-2026.04 | 31.8 | |
| LlamaModel=Llama2026.03 | 28.07 |