Mathematical Reasoning on MATH 500 (Acc, Tokens, EFF)
94.6Accuracys1-mix-32B
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| s1-mix-32BBase Model=Qwen2.5-32B-Instruct2026.02 | 94.6 | 8,648 | 1.09 | |
| ThinkPrune(6k->3k)Base Model=Qwen3-8B2026.02 | 94.4 | 2,615 | 3.61 | |
| D-SFT->D-RL6kBase Model=Qwen3-8B, Inference Protocol=adaptive2026.02 | 94.2 | 2,764 | 3.4 | |
| MURBase Model=Qwen3-8B2026.02 | 93.8 | 5,328 | 1.76 | |
| ThinkPrune(RL)Base Model=QwQ-32B2026.02 | 93.8 | 2,162 | 4.34 | |
| D-SFT->D-RL3k->D-RL6kBase Model=Qwen3-8B, Inference Protocol=step2026.02 | 93.6 | 4,271 | 2.19 | |
| D-SFT->D-RL6kBase Model=Qwen3-8B, Inference Protocol=step2026.02 | 93.6 | 4,539 | 2.06 | |
| ThinkPrune(6k)Base Model=Qwen3-8B2026.02 | 93.6 | 3,074 | 3.04 | |
| DR.SAFBase Model=R1-Distill-Qwen3-8B2026.02 | 93.3 | 2,168 | 4.3 | |
| D-SFT->D-RL3k->D-RL6kBase Model=Qwen3-8B, Inference Protocol=adaptive2026.02 | 93.2 | 2,755 | 3.38 | |
| OriginalBase Model=Qwen3-8B2026.02 | 93 | 5,668 | 1.64 | |
| D-SFT->D-RL6kBase Model=Qwen3-8B, Inference Protocol=draft2026.02 | 93 | 1,453 | 6.39 | |
| SimPO(FCS+Reflection)Base Model=QwQ-32B-Preview2026.02 | 92.8 | 1,330 | 6.97 | |
| TOPS-Iter-DPOBase Model=Qwen2.5-32B-Instruct2026.02 | 91.6 | 1,731 | 5.28 | |
| O1-Pruner(RL)Base Model=QwQ-32B-Preview2026.02 | 91 | 1,385 | 6.57 | |
| D-SFT->D-RL3k->D-RL6kBase Model=Qwen3-8B, Inference Protocol=draft2026.02 | 90.6 | 986 | 9.18 | |
| D-SFT->D-RL3kBase Model=Qwen3-8B, Inference Protocol=draft2026.02 | 89.4 | 1,032 | 8.65 | |
| CTS(best EFF)Base Model=Qwen2.5-14B-Instruct2026.02 | 75.6 | 2,036 | 3.71 | |
| D-SFTBase Model=Qwen3-8B, Inference Protocol=draft2026.02 | 69.8 | 1,732 | 4.02 |