Mathematical Reasoning on Overall
89.6AccuracyWHISPER
Evaluation Results
| Method | Links | ||||||
|---|---|---|---|---|---|---|---|
| WHISPERBase Model=Qwen3-14B2025.10 | 89.6 | — | — | — | — | 63 | |
| ChainofDraftBase Model=Qwen3-14B2025.10 | 89.5 | — | — | — | — | 83.9 | |
| BeConciseBase Model=Qwen3-14B2025.10 | 88.7 | — | — | — | — | 88 | |
| OriginalBase Model=Qwen3-14B2025.10 | 87.9 | — | — | — | — | 100 | |
| GEPABase Model=Qwen3-14B2025.10 | 87.6 | — | — | — | — | 75.1 | |
| DEER*Base Model=Qwen3-14B2025.10 | 87.6 | — | — | — | — | 80.5 | |
| WHISPERBase Model=DeepSeek-R1-Distill-Qwen-14B2025.10 | 86.3 | — | — | — | — | 78 | |
| BeConciseBase Model=DeepSeek-R1-Distill-Qwen-14B2025.10 | 86.1 | — | — | — | — | 94.4 | |
| OriginalBase Model=DeepSeek-R1-Distill-Qwen-14B2025.10 | 85.9 | — | — | — | — | 100 | |
| GEPABase Model=DeepSeek-R1-Distill-Qwen-14B2025.10 | 85.8 | — | — | — | — | 81.3 | |
| DEER*Base Model=DeepSeek-R1-Distill-Qwen-14B2025.10 | 83.9 | — | — | — | — | 83.3 | |
| ChainofDraftBase Model=DeepSeek-R1-Distill-Qwen-14B2025.10 | 82.3 | — | — | — | — | 78.6 | |
| Step-GRPOBackbone=Qwen3-8B2026.04 | 82.1 | — | — | — | 68 | — | |
| GRPOBackbone=Qwen3-8B2026.04 | 80.9 | — | — | — | 89.7 | — | |
| GRPO+SOPBackbone=Qwen3-8B2026.04 | 80.4 | — | — | — | 67.9 | — | |
| SGPOBackbone=QwQ-32B, Judge Model=DeepSeek-V3-03242025.05 | 80.17 | — | — | — | — | — | |
| VanillaBackbone=Qwen3-8B2026.04 | 79.9 | — | — | — | 100 | — | |
| GRPO-λBackbone=Qwen3-8B2026.04 | 79.9 | — | — | — | 62.9 | — | |
| VanillaBackbone=Qwen3-4B2026.04 | 79.3 | — | — | — | 100 | — | |
| GRPOBackbone=Qwen3-4B2026.04 | 79.3 | — | — | — | 86.9 | — | |
| GRPOBackbone=QwQ-32B2025.05 | 79.15 | — | — | — | — | — | |
| Step-GRPOBackbone=Qwen3-4B2026.04 | 79.1 | — | — | — | 68.7 | — | |
| WHISPERBase Model=DeepSeek-R1-Distill-LLaMA-8B2025.10 | 79 | — | — | — | — | 80.3 | |
| BaselineBackbone=QwQ-32B2025.05 | 78.84 | — | — | — | — | — | |
| OriginalBase Model=DeepSeek-R1-Distill-LLaMA-8B2025.10 | 78.5 | — | — | — | — | 100 | |
| BeConciseBase Model=DeepSeek-R1-Distill-LLaMA-8B2025.10 | 78.5 | — | — | — | — | 96.7 | |
| GRPO+LPBackbone=Qwen3-8B2026.04 | 78.4 | — | — | — | 53.2 | — | |
| GEPABase Model=DeepSeek-R1-Distill-LLaMA-8B2025.10 | 78.4 | — | — | — | — | 86.8 | |
| ChainofDraftBase Model=DeepSeek-R1-Distill-LLaMA-8B2025.10 | 78 | — | — | — | — | 92.6 | |
| GRPO-8kBackbone=Qwen3-4B2026.04 | 77.6 | — | — | — | 68.1 | — | |
| GRPO+LPBackbone=Qwen3-4B2026.04 | 77.6 | — | — | — | 52.8 | — | |
| GRPO-λBackbone=Qwen3-4B2026.04 | 77.5 | — | — | — | 61.5 | — | |
| GRPO+SOPBackbone=Qwen3-4B2026.04 | 77.4 | — | — | — | 69.2 | — | |
| DEER*Base Model=DeepSeek-R1-Distill-LLaMA-8B2025.10 | 76.5 | — | — | — | — | 84 | |
| GRPO-8kBackbone=Qwen3-8B2026.04 | 75.5 | — | — | — | 70.4 | — | |
| DEER+SFTBackbone=Qwen3-8B2026.04 | 72.6 | — | — | — | 78.9 | — | |
| NoThinkingBase Model=Qwen3-14B2025.10 | 69.8 | — | — | — | — | 28.8 | |
| DEER+SFTBackbone=Qwen3-4B2026.04 | 67.6 | — | — | — | 80.3 | — | |
| SGPOBackbone=DeepSeek-R1-Distill-Qwen-7B, Judge Model=DeepSeek-V3-03242025.05 | 66.19 | — | — | — | — | — | |
| GRPOBackbone=Qwen3-1.7B2026.04 | 66.1 | — | — | — | 88.3 | — | |
| SGPOBackbone=DeepSeek-R1-Distill-Qwen-7B, Judge Model=Qwen3-235B-A22B2025.05 | 65.42 | — | — | — | — | — | |
| SGPOBackbone=DeepSeek-R1-Distill-Qwen-7B, Judge Model=o4-mini-04162025.05 | 65.41 | — | — | — | — | — | |
| SGPOBackbone=DeepSeek-R1-Distill-Qwen-7B, Judge Model=QwQ-32B, Stability Parameters=w/o {beta,gamma}2025.05 | 65.08 | — | — | — | — | — | |
| SGPOBackbone=DeepSeek-R1-Distill-Qwen-7B, Judge Model=QwQ-32B2025.05 | 64.91 | — | — | — | — | — | |
| Segment Selective SFTModel Backbone=R1-Distill-Qwen-7B, Decoding Strategy=Greedy Decoding2026.01 | 64.5 | — | — | 8,499 | — | — | |
| GRPOBackbone=DeepSeek-R1-Distill-Qwen-7B2025.05 | 63.72 | — | — | — | — | — | |
| Step-GRPOBackbone=Qwen3-1.7B2026.04 | 63.2 | — | — | — | 69.7 | — | |
| BaselineBackbone=DeepSeek-R1-Distill-Qwen-7B2025.05 | 62.85 | — | — | — | — | — | |
| GRPO-8kBackbone=Qwen3-1.7B2026.04 | 62.5 | — | — | — | 70.8 | — | |
| NoThinkingBase Model=DeepSeek-R1-Distill-Qwen-14B2025.10 | 62.5 | — | — | — | — | 23.5 | |
| GRPO-λBackbone=Qwen3-1.7B2026.04 | 61.9 | — | — | — | 68.3 | — | |
| GRPO+SOPBackbone=Qwen3-1.7B2026.04 | 61.5 | — | — | — | 76.1 | — | |
| VanillaBackbone=Qwen3-1.7B2026.04 | 61.2 | — | — | — | 100 | — | |
| GRPO+LPBackbone=Qwen3-1.7B2026.04 | 60.7 | — | — | — | 57.5 | — | |
| NoThinkingBase Model=DeepSeek-R1-Distill-LLaMA-8B2025.10 | 56 | — | — | — | — | 31.9 | |
| SGPOBackbone=DeepSeek-R1-Distill-Llama-8B, Judge Model=Claude-3.72025.05 | 53.81 | — | — | — | — | — | |
| GRPOBackbone=DeepSeek-R1-Distill-Llama-8B2025.05 | 53.06 | — | — | — | — | — | |
| BaselineBackbone=DeepSeek-R1-Distill-Llama-8B2025.05 | 51.58 | — | — | — | — | — | |
| DEER+SFTBackbone=Qwen3-1.7B2026.04 | 51.2 | — | — | — | 100.2 | — | |
| Segment Selective SFTModel Backbone=R1-Distill-Qwen-1.5B, Decoding Strategy=Greedy Decoding2026.01 | 46.9 | — | — | 13,506 | — | — | |
| Segment Selective SFTModel Backbone=Qwen2.5-7B-Instruct, Decoding Strategy=Greedy Decoding2026.01 | 45.6 | — | — | 9,852 | — | — | |
| SGPOBackbone=Qwen2.5-32B-Instruct, Judge Model=o4-mini-04162025.05 | 45.06 | — | — | — | — | — | |
| ReLIFTBackbone=Qwen2.5-7B2025.06 | 45 | — | — | 3,696 | — | — | |
| GRPOBackbone=Qwen2.5-32B-Instruct2025.05 | 44.39 | — | — | — | — | — | |
| SFTBackbone=Qwen2.5-7B2025.06 | 44 | — | — | 6,183 | — | — | |
| BaselineBackbone=Qwen2.5-32B-Instruct2025.05 | 43.74 | — | — | — | — | — | |
| RLBackbone=Qwen2.5-7B2025.06 | 43.1 | — | — | 1,334 | — | — | |
| SGPOBackbone=Qwen2.5-14B-Instruct, Judge Model=o4-mini-04162025.05 | 41 | — | — | — | — | — | |
| GRPOBackbone=Qwen2.5-14B-Instruct2025.05 | 40.11 | — | — | — | — | — | |
| BaselineBackbone=Qwen2.5-14B-Instruct2025.05 | 39.85 | — | — | — | — | — | |
| Qwen-7B-InstructBackbone=Qwen2.5-7B2025.06 | 37 | — | — | 1,949 | — | — | |
| ReLIFTBackbone=Qwen2.5-Math-1.5B2025.06 | 36.5 | — | — | 2,437 | — | — | |
| Qwen-Math-1.5B-InstructBackbone=Qwen2.5-Math-1.5B2025.06 | 34.2 | — | — | 3,230 | — | — | |
| RLBackbone=Qwen2.5-Math-1.5B2025.06 | 34.2 | — | — | 1,653 | — | — | |
| SFTBackbone=Qwen2.5-Math-1.5B2025.06 | 32.6 | — | — | 6,870 | — | — | |
| Qwen-7BBackbone=Qwen2.5-7B2025.06 | 27.1 | — | — | 1,118 | — | — | |
| LLaMa-8B-InstructBackbone=LLaMA-3.1-8B2025.06 | 20.5 | — | — | 975 | — | — | |
| ReLIFTBackbone=LLaMA-3.1-8B2025.06 | 17.3 | — | — | 1,000 | — | — | |
| Qwen-Math-1.5BBackbone=Qwen2.5-Math-1.5B2025.06 | 15.5 | — | — | 1,712 | — | — | |
| RLBackbone=LLaMA-3.1-8B2025.06 | 14.6 | — | — | 767 | — | — | |
| SFTBackbone=LLaMA-3.1-8B2025.06 | 13.2 | — | — | 1,922 | — | — | |
| Segment Selective SFTModel Backbone=R1-Distill-Qwen-1.5B, Decoding Strategy=Temperature Sampling2026.01 | — | 51.7 | 73.2 | 9,388 | — | — | |
| Segment Selective SFTModel Backbone=R1-Distill-Qwen-7B, Decoding Strategy=Temperature Sampling2026.01 | — | 65.8 | 80 | 7,709 | — | — | |
| Segment Selective SFTModel Backbone=Qwen2.5-7B-Instruct, Decoding Strategy=Temperature Sampling2026.01 | — | 45 | 66.5 | 9,195 | — | — |