Mathematical Reasoning on Olympiad (Score)
83.4ScoreQwen3-235B
Evaluation Results
| Method | Links | |
|---|---|---|
| Qwen3-235BReasoning protocol=non-thinking, Tool usage=using tools2026.01 | 83.4 | |
| SYNTHAGENT-14BReasoning protocol=non-thinking, Tool usage=using tools2026.01 | 80.1 | |
| ToolStar-14BReasoning protocol=non-thinking, Tool usage=using tools2026.01 | 77.3 | |
| SYNTHAGENT-8BReasoning protocol=non-thinking, Tool usage=using tools2026.01 | 77.2 | |
| ToolStar-8BReasoning protocol=non-thinking, Tool usage=using tools2026.01 | 76.4 | |
| Qwen3-32BReasoning protocol=non-thinking, Tool usage=using tools2026.01 | 56.4 | |
| Qwen3-14BReasoning protocol=non-thinking, Tool usage=using tools2026.01 | 53.8 | |
| MathForgeBackbone=Qwen2.5-Math-7B, Training Dataset=MATH, Evaluation Protocol=Zero-shot2026.01 | 42.67 | |
| MQRBackbone=Qwen2.5-Math-7B, Training Dataset=MATH, Evaluation Protocol=Zero-shot2026.01 | 40.81 | |
| DGPOBackbone=Qwen2.5-Math-7B, Training Dataset=MATH, Evaluation Protocol=Zero-shot2026.01 | 38.33 | |
| GPGBackbone=Qwen2.5-Math-7B, Training Dataset=MATH, Evaluation Protocol=Zero-shot2026.01 | 37.67 | |
| GRPOBackbone=Qwen2.5-Math-7B, Training Dataset=MATH, Evaluation Protocol=Zero-shot2026.01 | 37.33 | |
| GSPOBackbone=Qwen2.5-Math-7B, Training Dataset=MATH, Evaluation Protocol=Zero-shot2026.01 | 37.26 | |
| DAPOBackbone=Qwen2.5-Math-7B, Training Dataset=MATH, Evaluation Protocol=Zero-shot2026.01 | 37.22 | |
| GRPO-ADBackbone=Qwen2.5-Math-7B, Training Dataset=MATH, Evaluation Protocol=Zero-shot2026.01 | 37.07 | |
| Dr.GRPOBackbone=Qwen2.5-Math-7B, Training Dataset=MATH, Evaluation Protocol=Zero-shot2026.01 | 35.89 | |
| Base ModelBackbone=Qwen2.5-Math-7B, Training Dataset=MATH, Evaluation Protocol=Zero-shot2026.01 | 16.33 |