Math Reasoning on OlympiadBench (Pass@1 accuracy)
48.2Pass@1 Accuracys1.1-7B
Evaluation Results
| Method | Links | |
|---|---|---|
| s1.1-7BBackbone=Qwen2.5-7B, Pure SFT?=false2025.12 | 48.2 | |
| Multiplex ThinkingBackbone=DeepSeek-R1-Distill-Qwen-7B2026.01 | 41.7 | |
| Stochastic Soft ThinkingBackbone=DeepSeek-R1-Distill-Qwen-7B2026.01 | 40.6 | |
| Qwen InstructBackbone=Qwen2.5-7B, Pure SFT?=false2025.12 | 38.7 | |
| Discrete RLBackbone=DeepSeek-R1-Distill-Qwen-7B2026.01 | 38 | |
| Qwen InstructBackbone=Qwen2.5-Math-1.5B, Pure SFT?=false2025.12 | 37.9 | |
| Discrete CoTBackbone=DeepSeek-R1-Distill-Qwen-7B2026.01 | 35.6 | |
| LadderBackbone=Qwen2.5-7B, Pure SFT?=true2025.12 | 34.3 | |
| QLoRABackbone=Qwen2.5-Math-1.5B, Pure SFT?=true2025.12 | 33.7 | |
| LadderBackbone=Qwen2.5-Math-1.5B, Pure SFT?=true2025.12 | 32.7 | |
| QLoRABackbone=Qwen2.5-7B, Pure SFT?=true2025.12 | 32 | |
| Multiplex ThinkingBackbone=DeepSeek-R1-Distill-Qwen-1.5B2026.01 | 31.3 | |
| Discrete RLBackbone=DeepSeek-R1-Distill-Qwen-1.5B2026.01 | 31.2 | |
| Stochastic Soft ThinkingBackbone=DeepSeek-R1-Distill-Qwen-1.5B2026.01 | 30.6 | |
| Discrete CoTBackbone=DeepSeek-R1-Distill-Qwen-1.5B2026.01 | 30.5 | |
| Qwen BaseBackbone=Qwen2.5-7B, Pure SFT?=true2025.12 | 30.2 | |
| Full SFTBackbone=Qwen2.5-7B, Pure SFT?=false2025.12 | 27.6 | |
| Qwen BaseBackbone=Qwen2.5-Math-1.5B, Pure SFT?=true2025.12 | 23.8 | |
| Full SFTBackbone=Qwen2.5-Math-1.5B, Pure SFT?=true2025.12 | 23.2 |