Mathematical Reasoning on Average (AIME25, AMC23, MATH500)
67.59Mean@32+GRPO+Soft Thinking
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| +GRPO+Soft ThinkingBackbone=DeepSeek-R1-Distill-Qwen-7B2026.06 | 67.59 | 80.93 | 82.21 | |
| +GRPOBackbone=DeepSeek-R1-Distill-Qwen-7B2026.06 | 67.18 | 80.87 | 81.94 | |
| +N-GRPOBackbone=DeepSeek-R1-Distill-Qwen-7B2026.06 | 66.64 | 82.56 | 84.2 | |
| +STHTBackbone=DeepSeek-R1-Distill-Qwen-7B2026.06 | 65.98 | 81.09 | 82.53 | |
| Base ModelBackbone=DeepSeek-R1-Distill-Qwen-7B2026.06 | 65.8 | 79.96 | 81.23 | |
| +Soft ThinkingBackbone=DeepSeek-R1-Distill-Qwen-7B2026.06 | 65.56 | 80.07 | 81.47 | |
| +N-GRPOBackbone=DeepSeek-R1-Distill-Qwen-1.5B2026.06 | 54.11 | 76.82 | 79.17 | |
| +GRPO+Soft ThinkingBackbone=DeepSeek-R1-Distill-Qwen-1.5B2026.06 | 53.93 | 75.82 | 77.53 | |
| +GRPOBackbone=DeepSeek-R1-Distill-Qwen-1.5B2026.06 | 53.62 | 75.49 | 77.41 | |
| +Soft ThinkingBackbone=DeepSeek-R1-Distill-Qwen-1.5B2026.06 | 53.54 | 74.56 | 77.18 | |
| Base ModelBackbone=DeepSeek-R1-Distill-Qwen-1.5B2026.06 | 53.28 | 73.05 | 74.62 | |
| +STHTBackbone=DeepSeek-R1-Distill-Qwen-1.5B2026.06 | 52.42 | 75.28 | 78.05 | |
| +GRPOBackbone=Qwen3-1.7B-Base2026.06 | 37.85 | 59.75 | 63.01 | |
| +N-GRPOBackbone=Qwen3-1.7B-Base2026.06 | 28.98 | 58.36 | 63.46 | |
| Base ModelBackbone=Qwen3-1.7B-Base2026.06 | 27.99 | 56.63 | 61.09 | |
| +STHTBackbone=Qwen3-1.7B-Base2026.06 | 27.89 | 56.93 | 61.94 | |
| +GRPOBackbone=Llama-3.2-1B2026.06 | 15.78 | 39.65 | 44.77 | |
| +N-GRPOBackbone=Llama-3.2-1B2026.06 | 13.27 | 40.01 | 46.34 | |
| +STHTBackbone=Llama-3.2-1B2026.06 | 12.83 | 38.1 | 44.17 | |
| Base ModelBackbone=Llama-3.2-1B2026.06 | 9.03 | 34.81 | 41.61 |