Mathematical Reasoning on Math-500 (Pass@1, #Tok)
94.34Pass@1 AccuracyQwen3-14B MixReasoning
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| Qwen3-14B MixReasoningMode=MixReasoning, Base Model=Qwen3-14B2025.10 | 94.34 | 3,017 | |
| QwQ-32B MixReasoningMode=MixReasoning, Base Model=QwQ-32B2025.10 | 94.3 | 3,297 | |
| Qwen3-14BMode=Original, Base Model=Qwen3-14B2025.10 | 93.84 | 4,659 | |
| QwQ-32BMode=Original, Base Model=QwQ-32B2025.10 | 93.8 | 4,508 | |
| QwQ-32B Concise ModeMode=Concise Mode, alpha=32, Base Model=QwQ-32B2025.10 | 92.9 | 2,264 | |
| Qwen3-8B MixReasoningMode=MixReasoning, Base Model=Qwen3-8B2025.10 | 92.76 | 3,483 | |
| Qwen3-8BMode=Original, Base Model=Qwen3-8B2025.10 | 92.3 | 5,104 | |
| DeepSeek-R1-7BMode=Original, Base Model=DeepSeek-R1-7B2025.10 | 90.24 | 3,351 | |
| DeepSeek-R1-7B MixReasoningMode=MixReasoning, Base Model=DeepSeek-R1-7B2025.10 | 89.76 | 2,187 | |
| Qwen3-14B Concise ModeMode=Concise Mode, alpha=32, Base Model=Qwen3-14B2025.10 | 89.64 | 1,878 | |
| BaselineBackbone=R1-Llama-8B2026.06 | 86.6 | 4,333 | |
| DyConBackbone=R1-Llama-8B2026.06 | 86.6 | 3,633 | |
| Qwen3-14B Concise ModeMode=Concise Mode, alpha=64, Base Model=Qwen3-14B2025.10 | 86.3 | 1,071 | |
| QwQ-32B Concise ModeMode=Concise Mode, alpha=64, Base Model=QwQ-32B2025.10 | 86.16 | 1,238 | |
| Qwen3-8B Concise ModeMode=Concise Mode, alpha=32, Base Model=Qwen3-8B2025.10 | 85.34 | 2,197 | |
| DeepSeek-R1-7B Concise ModeMode=Concise Mode, alpha=32, Base Model=DeepSeek-R1-7B2025.10 | 84.32 | 2,230 | |
| Qwen3-8B Concise ModeMode=Concise Mode, alpha=64, Base Model=Qwen3-8B2025.10 | 82.4 | 1,535 | |
| DeepSeek-R1-7B Concise ModeMode=Concise Mode, alpha=64, Base Model=DeepSeek-R1-7B2025.10 | 80.64 | 1,725 | |
| NoThinkingBackbone=R1-Llama-8B2026.06 | 66.2 | 2,680 |