Mathematical Reasoning on AMC 23 (Mean@32, Pass@16, Pass@32)
82.81Mean@32+GRPO+Soft Thinking
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| +GRPO+Soft ThinkingBackbone=DeepSeek-R1-Distill-Qwen-7B2026.06 | 82.81 | 94.16 | 94.7 | |
| +GRPOBackbone=DeepSeek-R1-Distill-Qwen-7B2026.06 | 81.88 | 94.28 | 94.87 | |
| +N-GRPOBackbone=DeepSeek-R1-Distill-Qwen-7B2026.06 | 80.7 | 96.92 | 98.13 | |
| +STHTBackbone=DeepSeek-R1-Distill-Qwen-7B2026.06 | 80.23 | 95.43 | 96.49 | |
| +Soft ThinkingBackbone=DeepSeek-R1-Distill-Qwen-7B2026.06 | 80.08 | 93.96 | 94.7 | |
| Base ModelBackbone=DeepSeek-R1-Distill-Qwen-7B2026.06 | 79.92 | 93.5 | 94.16 | |
| +Soft ThinkingBackbone=DeepSeek-R1-Distill-Qwen-1.5B2026.06 | 64.77 | 94.03 | 96.09 | |
| Base ModelBackbone=DeepSeek-R1-Distill-Qwen-1.5B2026.06 | 64.14 | 91.73 | 92.37 | |
| +N-GRPOBackbone=DeepSeek-R1-Distill-Qwen-1.5B2026.06 | 64.14 | 94.07 | 96.18 | |
| +GRPOBackbone=DeepSeek-R1-Distill-Qwen-1.5B2026.06 | 63.91 | 93.42 | 94.6 | |
| +GRPO+Soft ThinkingBackbone=DeepSeek-R1-Distill-Qwen-1.5B2026.06 | 63.75 | 93.91 | 95.96 | |
| +STHTBackbone=DeepSeek-R1-Distill-Qwen-1.5B2026.06 | 62.03 | 93.75 | 96.88 | |
| +GRPOBackbone=Qwen3-1.7B-Base2026.06 | 43.28 | 74.48 | 79.35 | |
| +N-GRPOBackbone=Qwen3-1.7B-Base2026.06 | 30.86 | 71.49 | 78.25 | |
| Base ModelBackbone=Qwen3-1.7B-Base2026.06 | 30.78 | 69.9 | 76.4 | |
| +STHTBackbone=Qwen3-1.7B-Base2026.06 | 30 | 70.57 | 76.53 | |
| +GRPOBackbone=Llama-3.2-1B2026.06 | 15.16 | 54.29 | 63.86 | |
| +N-GRPOBackbone=Llama-3.2-1B2026.06 | 11.95 | 54.09 | 65.88 | |
| Base ModelBackbone=Llama-3.2-1B2026.06 | 11.33 | 50.28 | 62.44 | |
| +STHTBackbone=Llama-3.2-1B2026.06 | 11.25 | 49.62 | 61.19 |