Mathematical Reasoning on MATH500 (Mean@32, Pass@16, Pass@32)
85.4Mean@32+GRPO
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| +GRPOBackbone=DeepSeek-R1-Distill-Qwen-7B2026.06 | 85.4 | 92.21 | 92.63 | |
| +GRPO+Soft ThinkingBackbone=DeepSeek-R1-Distill-Qwen-7B2026.06 | 85.39 | 92.44 | 93.03 | |
| +N-GRPOBackbone=DeepSeek-R1-Distill-Qwen-7B2026.06 | 84.94 | 92.77 | 93.28 | |
| Base ModelBackbone=DeepSeek-R1-Distill-Qwen-7B2026.06 | 84.24 | 91.66 | 92.14 | |
| +Soft ThinkingBackbone=DeepSeek-R1-Distill-Qwen-7B2026.06 | 84.01 | 92.08 | 92.59 | |
| +STHTBackbone=DeepSeek-R1-Distill-Qwen-7B2026.06 | 83.95 | 92.08 | 92.71 | |
| +GRPOBackbone=DeepSeek-R1-Distill-Qwen-1.5B2026.06 | 75.61 | 89.43 | 90.32 | |
| +GRPO+Soft ThinkingBackbone=DeepSeek-R1-Distill-Qwen-1.5B2026.06 | 75.53 | 89.6 | 90.7 | |
| +Soft ThinkingBackbone=DeepSeek-R1-Distill-Qwen-1.5B2026.06 | 75.12 | 89.77 | 90.9 | |
| Base ModelBackbone=DeepSeek-R1-Distill-Qwen-1.5B2026.06 | 74.88 | 89.38 | 90.29 | |
| +N-GRPOBackbone=DeepSeek-R1-Distill-Qwen-1.5B2026.06 | 74.87 | 89.92 | 91.05 | |
| +STHTBackbone=DeepSeek-R1-Distill-Qwen-1.5B2026.06 | 74.81 | 89.43 | 90.55 | |
| +GRPOBackbone=Qwen3-1.7B-Base2026.06 | 64.76 | 84.73 | 86.22 | |
| +N-GRPOBackbone=Qwen3-1.7B-Base2026.06 | 52.86 | 80.7 | 83.66 | |
| +STHTBackbone=Qwen3-1.7B-Base2026.06 | 51.29 | 80.71 | 83.51 | |
| Base ModelBackbone=Qwen3-1.7B-Base2026.06 | 50.37 | 80.84 | 83.71 | |
| +GRPOBackbone=Llama-3.2-1B2026.06 | 31.97 | 61.93 | 66.07 | |
| +N-GRPOBackbone=Llama-3.2-1B2026.06 | 27.54 | 62.44 | 68.04 | |
| +STHTBackbone=Llama-3.2-1B2026.06 | 27.03 | 62.04 | 67.15 | |
| Base ModelBackbone=Llama-3.2-1B2026.06 | 15.64 | 52.84 | 60.23 |