Mathematical Reasoning on Overall Macro-average
70.97Accuracy (%)F-1
Evaluation Results
| Method | Links | |
|---|---|---|
| F-1Model=GPT-5, Model Category=Proprietary2026.01 | 70.97 | |
| F-1Model=Gemini 2.5 Pro, Model Category=Proprietary2026.01 | 67.48 | |
| CoTModel=Gemini 2.5 Pro, Model Category=Proprietary2026.01 | 65.15 | |
| CoTModel=GPT-5, Model Category=Proprietary2026.01 | 64.73 | |
| F-1Model=Qwen3-30B, Model Category=Open Source2026.01 | 63.33 | |
| PoTModel=Gemini 2.5 Pro, Model Category=Proprietary2026.01 | 60.74 | |
| PoTModel=GPT-5, Model Category=Proprietary2026.01 | 58.54 | |
| Zero-ShotModel=GPT-5, Model Category=Proprietary2026.01 | 58.03 | |
| CoTModel=Qwen3-30B, Model Category=Open Source2026.01 | 57.72 | |
| PoTModel=Qwen3-30B, Model Category=Open Source2026.01 | 55.51 | |
| F-1Model=Qwen3-235B, Model Category=Open Source2026.01 | 53.02 | |
| Zero-ShotModel=Gemini 2.5 Pro, Model Category=Proprietary2026.01 | 52.85 | |
| Zero-ShotModel=Qwen3-30B, Model Category=Open Source2026.01 | 51.47 | |
| F-1Model=DeepSeek-V3.1, Model Category=Open Source2026.01 | 50.53 | |
| PoTModel=Qwen3-235B, Model Category=Open Source2026.01 | 46.9 | |
| CoTModel=DeepSeek-V3.1, Model Category=Open Source2026.01 | 45.15 | |
| CoTModel=Qwen3-235B, Model Category=Open Source2026.01 | 43.74 | |
| Zero-ShotModel=DeepSeek-V3.1, Model Category=Open Source2026.01 | 42.65 | |
| Zero-ShotModel=Qwen3-235B, Model Category=Open Source2026.01 | 42.47 | |
| PoTModel=DeepSeek-V3.1, Model Category=Open Source2026.01 | 41.52 |