Mathematical Reasoning on AIME24, AIME25, AMC23, MATH500, Minerva, and Olympiad
41.64Average AccuracyReSum
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| ReSumBackbone=Qwen2.5-Math-7B2026.06 | 41.64 | 4.03 | |
| DGPOBackbone=Qwen2.5-Math-7B2026.06 | 39.79 | 2.18 | |
| GRPO-ADBackbone=Qwen2.5-Math-7B2026.06 | 38.26 | 0.65 | |
| DAPOBackbone=Qwen2.5-Math-7B2026.06 | 37.94 | 0.33 | |
| GPGBackbone=Qwen2.5-Math-7B2026.06 | 37.93 | 0.32 | |
| GSPOBackbone=Qwen2.5-Math-7B2026.06 | 37.71 | 0.1 | |
| GRPOBackbone=Qwen2.5-Math-7B2026.06 | 37.61 | — | |
| Dr. GRPOBackbone=Qwen2.5-Math-7B2026.06 | 37.4 | -0.21 | |
| ReSumBackbone=Qwen2.5-Math-1.5B2026.06 | 33.07 | 3.68 | |
| DGPOBackbone=Qwen2.5-Math-1.5B2026.06 | 30.71 | 1.32 | |
| GRPOBackbone=Qwen2.5-Math-1.5B2026.06 | 29.39 | — | |
| ReSumBackbone=Qwen2.5-3B2026.06 | 28.81 | 3.34 | |
| DGPOBackbone=Qwen2.5-3B2026.06 | 27.19 | 1.72 | |
| GRPOBackbone=Qwen2.5-3B2026.06 | 25.47 | — | |
| Base ModelBackbone=Qwen2.5-Math-7B2026.06 | 22.04 | — | |
| Base ModelBackbone=Qwen2.5-3B2026.06 | 17.99 | — | |
| Base ModelBackbone=Qwen2.5-Math-1.5B2026.06 | 17.82 | — | |
| ReSumBackbone=DeepSeek-Math-7B2026.06 | 17.32 | 2.31 | |
| DGPOBackbone=DeepSeek-Math-7B2026.06 | 16.53 | 1.62 | |
| GRPOBackbone=DeepSeek-Math-7B2026.06 | 14.91 | — | |
| Base ModelBackbone=DeepSeek-Math-7B2026.06 | 10.57 | — |