Mathematical Reasoning on MATH 500 (Acc, SL, SE)
99.1Accuracy (Acc)Qwen3-Base SAT
Evaluation Results
| Method | Links | |||||||||
|---|---|---|---|---|---|---|---|---|---|---|
| Qwen3-Base SATSize=3×4B2026.04 | 99.1 | — | — | — | — | — | — | — | — | |
| Qwen3-A3BSize=30B2026.04 | 98 | — | — | — | — | — | — | — | — | |
| QwQSize=32B2026.04 | 98 | — | — | — | — | — | — | — | — | |
| OpenAI o3-mini (medium)Size=/2026.04 | 98 | — | — | — | — | — | — | — | — | |
| Qwen3Params=32B2026.04 | 97.8 | — | — | — | — | — | — | — | — | |
| I-DLMParams=32B, Decoding=ISD (N=4, sampling)2026.04 | 97.6 | — | — | — | — | — | — | — | — | |
| Qwen3 (thinking)Size=32B2026.04 | 97.2 | — | — | — | — | — | — | — | — | |
| VanillaReasoner=Qwen3-8B2026.06 | 97.2 | — | — | — | — | 5,474 | — | — | — | |
| I-DLMParams=8B, Decoding=ISD (N=4, sampling)2026.04 | 96.8 | — | — | — | — | — | — | — | — | |
| KnowRL-Nemotron-1.5BHint Setting=CBRS, Evaluation Protocol=mean@82026.04 | 96.45 | — | — | — | — | — | — | — | — | |
| KnowRL-Nemotron-1.5BHint Setting=CSS, Evaluation Protocol=mean@82026.04 | 96.2 | — | — | — | — | — | — | — | — | |
| Qwen3-Base Debate + JudgeSize=3×8B2026.04 | 95.9 | — | — | — | — | — | — | — | — | |
| Qwen3Params=8B2026.04 | 95.8 | — | — | — | — | — | — | — | — | |
| KnowRL-Nemotron-1.5BHint Setting=w/o KP, Evaluation Protocol=mean@82026.04 | 95.7 | — | — | — | — | — | — | — | — | |
| Qwen3-Base Role-playSize=3×8B2026.04 | 95.7 | — | — | — | — | — | — | — | — | |
| StepFlowBackbone=DeepSeek-R1-Distill-Qwen 32B2026.04 | 95.6 | — | — | — | — | — | — | — | — | |
| DEERReasoner=Qwen3-8B2026.06 | 95.6 | — | — | — | 9.7 | 4,941 | — | — | — | |
| Qwen3-Base DebateSize=3×8B2026.04 | 95.2 | — | — | — | — | — | — | — | — | |
| ACTSReasoner=Qwen3-8B2026.06 | 95.2 | — | — | — | 37 | 3,448 | — | — | — | |
| LessIsMoreModel=Qwen3-14B, Token Budget=4K, Sampled answers=82025.08 | 95.14 | — | — | — | — | — | — | — | — | |
| LessIsMoreModel=Qwen3-14B, Token Budget=6K, Sampled answers=82025.08 | 95.12 | — | — | — | — | — | — | — | — | |
| Full AttnModel=Qwen3-14B, Sampled answers=82025.08 | 95.1 | — | — | — | — | — | — | — | — | |
| ASAGBackbone=Qwen3-14B2026.06 | 95 | 3,505 | — | — | — | — | 74.2 | — | — | |
| JustRLHint Setting=CBRS, Evaluation Protocol=mean@82026.04 | 94.85 | — | — | — | — | — | — | — | — | |
| LessIsMoreModel=Qwen3-14B, Token Budget=2K, Sampled answers=82025.08 | 94.85 | — | — | — | — | — | — | — | — | |
| JustRLHint Setting=CSS, Evaluation Protocol=mean@82026.04 | 94.59 | — | — | — | — | — | — | — | — | |
| LessIsMoreModel=Qwen3-8B, Token Budget=2K, Sampled answers=82025.08 | 94.55 | — | — | — | — | — | — | — | — | |
| DeepSeek-R1 Distill LlamaSize=70B2026.04 | 94.5 | — | — | — | — | — | — | — | — | |
| LessIsMoreModel=Qwen3-8B, Token Budget=4K, Sampled answers=82025.08 | 94.45 | — | — | — | — | — | — | — | — | |
| Full AttnModel=Qwen3-8B, Sampled answers=82025.08 | 94.43 | — | — | — | — | — | — | — | — | |
| LessIsMoreModel=Qwen3-8B, Token Budget=6K, Sampled answers=82025.08 | 94.42 | — | — | — | — | — | — | — | — | |
| LessIsMoreModel=Qwen3-14B, Token Budget=1K, Sampled answers=82025.08 | 94.4 | — | — | — | — | — | — | — | — | |
| DeepSeek-R1-Distill-Qwen 32BInference Protocol=Baseline2026.04 | 94.3 | — | — | — | — | — | — | — | — | |
| LessIsMoreModel=Qwen3-4B, Token Budget=6K, Sampled answers=82025.08 | 94.22 | — | — | — | — | — | — | — | — | |
| LessIsMoreModel=Qwen3-4B, Token Budget=4K, Sampled answers=82025.08 | 94.16 | — | — | — | — | — | — | — | — | |
| JustRLHint Setting=w/o KP, Evaluation Protocol=mean@82026.04 | 94.15 | — | — | — | — | — | — | — | — | |
| LessIsMoreModel=Qwen3-4B, Token Budget=2K, Sampled answers=82025.08 | 94.12 | — | — | — | — | — | — | — | — | |
| QuestAHint Setting=CSS, Evaluation Protocol=mean@82026.04 | 94.05 | — | — | — | — | — | — | — | — | |
| ACTSπSFTReasoner=Qwen3-8B2026.06 | 94 | — | — | — | 34.7 | 3,573 | — | — | — | |
| DEERBackbone=Qwen3-14B2026.06 | 94 | 3,410 | — | — | — | — | 72.2 | — | — | |
| QuestAHint Setting=CBRS, Evaluation Protocol=mean@82026.04 | 93.94 | — | — | — | — | — | — | — | — | |
| Full AttnModel=Qwen3-4B, Sampled answers=82025.08 | 93.93 | — | — | — | — | — | — | — | — | |
| DynasorBackbone=Qwen3-14B2026.06 | 93.8 | 3,958 | — | — | — | — | 83.8 | — | — | |
| Pass@k†Backbone=Qwen2.5-7B-Instruct, N=322026.05 | 93.67 | — | — | — | — | 18,788 | — | — | — | |
| VanillaBackbone=Qwen3-14B2026.06 | 93.4 | 4,725 | — | — | — | — | 100 | — | — | |
| LessIsMoreModel=Qwen3-8B, Token Budget=1K, Sampled answers=82025.08 | 93.35 | — | — | — | — | — | — | — | — | |
| TALEBackbone=Qwen3-14B2026.06 | 93.2 | 3,616 | — | — | — | — | 76.5 | — | — | |
| ASAGBackbone=Qwen3-8B2026.06 | 93 | 3,152 | — | — | — | — | 64 | — | — | |
| QuestAHint Setting=w/o KP, Evaluation Protocol=mean@82026.04 | 92.95 | — | — | — | — | — | — | — | — | |
| Nemotron-1.5BHint Setting=CSS, Evaluation Protocol=mean@82026.04 | 92.9 | — | — | — | — | — | — | — | — | |
| ASAGBackbone=Qwen3-4B2026.06 | 92.8 | 3,325 | — | — | — | — | 67.7 | — | — | |
| Nemotron-1.5BHint Setting=CBRS, Evaluation Protocol=mean@82026.04 | 92.65 | — | — | — | — | — | — | — | — | |
| VanillaReasoner=DeepSeek-R1-Distill-Qwen-7B2026.06 | 92.6 | — | — | — | — | 4,339 | — | — | — | |
| DEERBackbone=Qwen3-4B2026.06 | 92.6 | 3,197 | — | — | — | — | 65.1 | — | — | |
| LessIsMoreModel=Qwen3-4B, Token Budget=1K, Sampled answers=82025.08 | 92.5 | — | — | — | — | — | — | — | — | |
| HAPOBackbone=Qwen3-14B2025.09 | 92.47 | — | — | — | — | — | — | — | — | |
| VanillaBackbone=Qwen3-4B2026.06 | 92.4 | 4,910 | — | — | — | — | 100 | — | — | |
| DynasorBackbone=Qwen3-8B2026.06 | 92.4 | 3,361 | — | — | — | — | 68.2 | — | — | |
| DEERBackbone=Qwen3-8B2026.06 | 92.4 | 2,966 | — | — | — | — | 60.2 | — | — | |
| Nemotron-1.5BHint Setting=w/o KP, Evaluation Protocol=mean@82026.04 | 92.35 | — | — | — | — | — | — | — | — | |
| ASLEC-CASLBackbone=Qwen-4B-Instruct2026.04 | 92.2 | — | — | — | — | — | — | — | — | |
| OriginalModel=DeepSeek-R1-Distill-Qwen-7B2025.08 | 92.2 | 4,223 | — | — | — | — | — | — | — | |
| VanillaBackbone=Qwen3-8B2026.06 | 92.2 | 4,926 | — | — | — | — | 100 | — | — | |
| StepFlowBackbone=QwQ-32B-Preview2026.04 | 92 | — | — | — | — | — | — | — | — | |
| TALEBackbone=Qwen3-8B2026.06 | 91.8 | 3,682 | — | — | — | — | 74.7 | — | — | |
| DynasorBackbone=Qwen3-4B2026.06 | 91.6 | 2,965 | — | — | — | — | 60.4 | — | — | |
| Qwen3-Base-DAPOSize=8B2026.04 | 91.5 | — | — | — | — | — | — | — | — | |
| LCPOModel=DeepSeek-R1-Distill-Qwen-7B2025.08 | 91.4 | 2,033 | — | -0.8 | -51.86 | — | — | — | — | |
| Pass@k†Backbone=Phi-4-mini-Instruct, N=322026.05 | 91.07 | — | — | — | — | 16,774 | — | — | — | |
| CE-GPPOBackbone=DS-R1-Distill-Qwen-1.5B, RL Mitigation Strategy=CE-GPPO, Beta coefficients (β1, β2)=β1 = 0.5, β2 = 12025.09 | 91 | — | — | — | — | — | — | — | — | |
| Qwen3-Base-GRPOSize=8B2026.04 | 90.7 | — | — | — | — | — | — | — | — | |
| QwQ-32B-PreviewInference Protocol=Baseline2026.04 | 90.6 | — | — | — | — | — | — | — | — | |
| ASLEC-DROPBackbone=Qwen-4B-Instruct2026.04 | 90.6 | — | — | — | — | — | — | — | — | |
| AdaptThinkModel=DeepSeek-R1-Distill-Qwen-7B2025.08 | 90.6 | 1,975 | — | -1.6 | -53.23 | — | — | — | — | |
| GSPOBackbone=DS-R1-Distill-Qwen-1.5B, RL Mitigation Strategy=GSPO2025.09 | 90.3 | — | — | — | — | — | — | — | — | |
| RL-PLUSBase Model=Qwen2.5-Math-7B, Training Method=RL-PLUS2025.07 | 90.2 | — | — | — | — | — | — | — | — | |
| RL-PLUSBase Model=Qwen2.5-Math-7B2025.07 | 90.2 | — | — | — | — | — | — | — | — | |
| Qwen3-BaseSize=14B2026.04 | 90.1 | — | — | — | — | — | — | — | — | |
| Re-ScheduleBackbone=Qwen3-4B-Base2025.10 | 89.8 | — | — | — | — | — | — | — | — | |
| ASAGBackbone=DeepSeek-R1-Distill-Qwen-7B2026.06 | 89.8 | 2,533 | — | — | — | — | 66.8 | — | — | |
| AutoThinkModel=DeepSeek-R1-Distill-Qwen-7B2025.08 | 89.4 | 2,187 | — | -2.8 | -48.21 | — | — | — | — | |
| DynasorBackbone=DeepSeek-R1-Distill-Qwen-7B2026.06 | 89.4 | 2,994 | — | — | — | — | 79 | — | — | |
| L12026.03 | 89.2 | 2,603 | 3.43 | — | — | — | — | — | — | |
| EAT2026.03 | 89.2 | 4,297 | 2.08 | — | — | — | — | — | — | |
| DEERBackbone=DeepSeek-R1-Distill-Qwen-7B2026.06 | 89.2 | 2,407 | — | — | — | — | 63.5 | — | — | |
| EDGE-GRPOBackbone=Qwen3-14B2025.09 | 89.12 | — | — | — | — | — | — | — | — | |
| JETBackbone=DS-Distill-Llama-8B2025.09 | 89 | 2,922 | — | — | — | — | — | — | — | |
| DAPO w/ Forking TokensBackbone=Qwen3-14B2025.09 | 88.9 | — | — | — | — | — | — | — | — | |
| ACCBackbone=Qwen3-4B-Base2025.10 | 88.8 | — | — | — | — | — | — | — | — | |
| LessIsMoreModel=DeepSeek-8B, Token Budget=4K, Sampled answers=82025.08 | 88.75 | — | — | — | — | — | — | — | — | |
| Qwen3-BaseSize=32B2026.04 | 88.6 | — | — | — | — | — | — | — | — | |
| TALEBackbone=DeepSeek-R1-Distill-Qwen-7B2026.06 | 88.6 | 2,738 | — | — | — | — | 72.2 | — | — | |
| LessIsMoreModel=DeepSeek-8B, Token Budget=6K, Sampled answers=82025.08 | 88.54 | — | — | — | — | — | — | — | — | |
| Entropy EnvBackbone=Qwen3-14B2025.09 | 88.35 | — | — | — | — | — | — | — | — | |
| Vanilla2026.03 | 88.33 | 4,554 | 1.94 | — | — | — | — | — | — | |
| Vanilla DAPOBackbone=Qwen3-14B2025.09 | 88.25 | — | — | — | — | — | — | — | — | |
| LessIsMoreModel=DeepSeek-8B, Token Budget=2K, Sampled answers=82025.08 | 88.15 | — | — | — | — | — | — | — | — | |
| BaseBackbone=DS-Distill-Llama-8B2025.09 | 88 | 4,299 | — | — | — | — | — | — | — | |
| BudgetGuidanceReasoner=Qwen3-8B2026.06 | 88 | — | — | — | 65.9 | 1,865 | — | — | — | |
| NoThinkingBackbone=Qwen3-14B2026.06 | 88 | 1,403 | — | — | — | — | 29.7 | — | — |