Mathematical Reasoning on AIME 25 (Mean@32, Pass@16, Pass@32)
34.58Mean@32+GRPO+Soft Thinking
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| +GRPO+Soft ThinkingBackbone=DeepSeek-R1-Distill-Qwen-7B2026.06 | 34.58 | 56.18 | 58.91 | |
| +GRPOBackbone=DeepSeek-R1-Distill-Qwen-7B2026.06 | 34.27 | 56.13 | 58.32 | |
| +N-GRPOBackbone=DeepSeek-R1-Distill-Qwen-7B2026.06 | 34.27 | 58 | 61.18 | |
| +STHTBackbone=DeepSeek-R1-Distill-Qwen-7B2026.06 | 33.75 | 55.76 | 58.4 | |
| Base ModelBackbone=DeepSeek-R1-Distill-Qwen-7B2026.06 | 33.23 | 54.73 | 57.38 | |
| +Soft ThinkingBackbone=DeepSeek-R1-Distill-Qwen-7B2026.06 | 32.6 | 54.17 | 57.12 | |
| +N-GRPOBackbone=DeepSeek-R1-Distill-Qwen-1.5B2026.06 | 23.33 | 46.48 | 50.28 | |
| +GRPO+Soft ThinkingBackbone=DeepSeek-R1-Distill-Qwen-1.5B2026.06 | 22.5 | 43.94 | 45.94 | |
| +GRPOBackbone=DeepSeek-R1-Distill-Qwen-1.5B2026.06 | 21.35 | 43.61 | 47.31 | |
| Base ModelBackbone=DeepSeek-R1-Distill-Qwen-1.5B2026.06 | 20.83 | 38.05 | 41.19 | |
| +Soft ThinkingBackbone=DeepSeek-R1-Distill-Qwen-1.5B2026.06 | 20.73 | 39.9 | 44.56 | |
| +STHTBackbone=DeepSeek-R1-Distill-Qwen-1.5B2026.06 | 20.42 | 42.66 | 46.73 | |
| +GRPOBackbone=Qwen3-1.7B-Base2026.06 | 5.52 | 20.03 | 23.47 | |
| +N-GRPOBackbone=Qwen3-1.7B-Base2026.06 | 3.23 | 22.87 | 28.47 | |
| Base ModelBackbone=Qwen3-1.7B-Base2026.06 | 2.81 | 19.15 | 23.18 | |
| +STHTBackbone=Qwen3-1.7B-Base2026.06 | 2.4 | 19.52 | 25.78 | |
| +N-GRPOBackbone=Llama-3.2-1B2026.06 | 0.31 | 3.49 | 5.09 | |
| +GRPOBackbone=Llama-3.2-1B2026.06 | 0.21 | 2.72 | 4.39 | |
| +STHTBackbone=Llama-3.2-1B2026.06 | 0.21 | 2.64 | 4.18 | |
| Base ModelBackbone=Llama-3.2-1B2026.06 | 0.1 | 1.31 | 2.15 |