Math Reasoning on GSM8K (Accuracy)
98.87AccuracyDMoA
Evaluation Results
| Method | Links | |
|---|---|---|
| DMoABackbone=gpt-oss-120b, Evaluation Paradigm=few-shot2026.05 | 98.87 | |
| DCCDModel Size=14B, Backbone=Qwen 2.5 14B, Algorithm=Draft Conditioned Constrained Decoding2026.02 | 95.15 | |
| ARG-DesignerBackbone=gpt-oss-120b, Evaluation Paradigm=few-shot2026.05 | 94.4 | |
| STEERBackbone=gpt-oss-120b2026.05 | 93.5 | |
| G-DesignerBackbone=gpt-oss-120b, Evaluation Paradigm=few-shot2026.05 | 93.35 | |
| SafeSieveBackbone=gpt-oss-120b2026.05 | 93.2 | |
| MAGEBackbone=Llama-3.1-8B, Execution Scaffold=Sonnet, Number of seeds=52026.05 | 92.5 | |
| MAGEBackbone=Llama-3.1-8B, Execution Scaffold=Opus, Number of seeds=52026.05 | 92 | |
| SpecReasonBackbone=gpt-oss-120b2026.05 | 91.4 | |
| DCCDModel Size=7B, Backbone=Qwen 2.5 7B, Algorithm=Draft Conditioned Constrained Decoding2026.02 | 91.28 | |
| CPModel Size=14B, Backbone=Qwen 2.5 14B, Algorithm=Constrained Prompting2026.02 | 91.13 | |
| CFModel Size=14B, Backbone=Qwen 2.5 14B, Algorithm=Constrained Few Shot2026.02 | 90.52 | |
| GPTSwarmBackbone=gpt-oss-120b2026.05 | 90.2 | |
| LLM-DebateBackbone=gpt-oss-120b2026.05 | 89.95 | |
| AFlowBackbone=gpt-oss-120b2026.05 | 89.5 | |
| AutoGenBackbone=gpt-oss-120b2026.05 | 89.4 | |
| TeacherModel=Qwen2.5-7B-Instruct, Role=Teacher2025.10 | 89.3 | |
| MoABackbone=gpt-oss-120b2026.05 | 88.52 | |
| Random GraphBackbone=gpt-oss-120b2026.05 | 88.25 | |
| Complete GraphBackbone=gpt-oss-120b2026.05 | 88.05 | |
| SCBackbone=gpt-oss-120b2026.05 | 87.66 | |
| CoTBackbone=gpt-oss-120b2026.05 | 87.35 | |
| ChainBackbone=gpt-oss-120b2026.05 | 87.23 | |
| VanillaBackbone=gpt-oss-120b2026.05 | 87.15 | |
| CDModel Size=14B, Backbone=Qwen 2.5 14B, Algorithm=Constrained Decoding (XGrammar)2026.02 | 86.43 | |
| TreeBackbone=gpt-oss-120b2026.05 | 86.35 | |
| StarBackbone=gpt-oss-120b2026.05 | 85.25 | |
| DCCDModel Size=3B, Backbone=Qwen 2.5 3B, Algorithm=Draft Conditioned Constrained Decoding2026.02 | 84.53 | |
| 8-shot, MetaBackbone=Llama-3.1-8B, Evaluation Protocol=8-shot2026.05 | 84.5 | |
| p*LLM Family=OLMo 2 (1B and 13B)2026.04 | 84.3 | |
| DCCDModel Size=8B, Backbone=Llama 3.1 8B, Algorithm=Draft Conditioned Constrained Decoding2026.02 | 83.02 | |
| GRPOModel=Qwen2.5-3B, Training Data=MATH, Inference template=chat inference template, Decoding strategy=Greedy2025.05 | 82.6 | |
| confidence betLLM Family=Qwen 3 (1.7B and 14B), lambda=0.12026.04 | 82.4 | |
| p*LLM Family=Qwen 3 (1.7B and 14B)2026.04 | 82.4 | |
| CFModel Size=7B, Backbone=Qwen 2.5 7B, Algorithm=Constrained Few Shot2026.02 | 82.26 | |
| confidence betLLM Family=Qwen 3 (1.7B and 14B), lambda=0.22026.04 | 82.1 | |
| GRPO-PVModel=Qwen2.5-3B, Training Data=MATH, Inference template=chat inference template, Decoding strategy=Greedy2025.05 | 82 | |
| Dual KADLLM Family=Qwen 3 (1.7B and 14B), lambda=0.42026.04 | 81.7 | |
| CDModel Size=7B, Backbone=Qwen 2.5 7B, Algorithm=Constrained Decoding (XGrammar)2026.02 | 81.58 | |
| Dual KADLLM Family=Qwen 3 (1.7B and 14B), lambda=0.32026.04 | 81.3 | |
| CDModel Size=8B, Backbone=Llama 3.1 8B, Algorithm=Constrained Decoding (XGrammar)2026.02 | 80.89 | |
| Imp. rewardLLM Family=Qwen 3 (1.7B and 14B)2026.04 | 80.7 | |
| CPModel Size=7B, Backbone=Qwen 2.5 7B, Algorithm=Constrained Prompting2026.02 | 80.06 | |
| χ2-DRTOBackbone=Llama3-8B2026.03 | 79.9 | |
| NudgingLLM Family=Qwen 3 (1.7B and 14B), lambda=0.42026.04 | 79.5 | |
| INTUITORModel=Qwen2.5-3B, Training Data=MATH, Inference template=chat inference template, Decoding strategy=Greedy2025.05 | 79.2 | |
| KL-DRTOBackbone=Llama3-8B2026.03 | 78.5 | |
| confidence betLLM Family=Qwen 3 (1.7B and 14B), lambda=02026.04 | 78.3 | |
| NudgingLLM Family=Qwen 3 (1.7B and 14B), lambda=0.32026.04 | 78.1 | |
| DistiLLM-2alpha=-5, Base Model=Qwen2.5-1.5B-Instruct2025.10 | 77.4 | |
| DistiLLM-2alpha=-1, Base Model=Qwen2.5-1.5B-Instruct2025.10 | 76.9 | |
| CPModel Size=8B, Backbone=Llama 3.1 8B, Algorithm=Constrained Prompting2026.02 | 76.8 | |
| pLLM Family=Qwen 3 (1.7B and 14B)2026.04 | 75.5 | |
| q*LLM Family=Qwen 3 (1.7B and 14B)2026.04 | 75.3 | |
| GRPOModel=Qwen2.5-1.5B, Training Data=MATH, Inference template=chat inference template, Decoding strategy=Greedy2025.05 | 74.7 | |
| INTUITOR-CodeModel=Qwen2.5-3B, Training Data=Codeforces, Inference template=chat inference template, Decoding strategy=Greedy2025.05 | 74.3 | |
| StudentModel=Qwen2.5-1.5B-Instruct, Role=Student2025.10 | 74.3 | |
| DCCDModel Size=1.5B, Backbone=Qwen 2.5 1.5B, Algorithm=Draft Conditioned Constrained Decoding2026.02 | 73.92 | |
| DPOBackbone=Llama3-8B2026.03 | 73.9 | |
| CDModel Size=3B, Backbone=Qwen 2.5 3B, Algorithm=Constrained Decoding (XGrammar)2026.02 | 73.24 | |
| RTOBackbone=Llama3-8B2026.03 | 73.2 | |
| PPOBackbone=Llama3-8B2026.03 | 73.2 | |
| GRPOBackbone=Llama3-8B2026.03 | 72.7 | |
| Dual KADLLM Family=OLMo 2 (1B and 13B), lambda=0.42026.04 | 72.3 | |
| CFModel Size=3B, Backbone=Qwen 2.5 3B, Algorithm=Constrained Few Shot2026.02 | 71.8 | |
| confidence betLLM Family=OLMo 2 (1B and 13B), lambda=0.22026.04 | 71.7 | |
| INTUITORModel=Qwen2.5-1.5B, Training Data=MATH, Inference template=chat inference template, Decoding strategy=Greedy2025.05 | 71.1 | |
| confidence betLLM Family=OLMo 2 (1B and 13B), lambda=02026.04 | 71.1 | |
| confidence betLLM Family=OLMo 2 (1B and 13B), lambda=0.12026.04 | 70.5 | |
| CFModel Size=8B, Backbone=Llama 3.1 8B, Algorithm=Constrained Few Shot2026.02 | 70.2 | |
| Dual KADLLM Family=OLMo 2 (1B and 13B), lambda=0.32026.04 | 69.5 | |
| BaseModel=Qwen2.5-3B, Training Data=-, Inference template=chat inference template, Decoding strategy=Greedy2025.05 | 67.3 | |
| LoRA + GASTBackbone=LLaMA3-8B2026.03 | 66.4 | |
| 0-shot CoTBackbone=Llama-3.1-8B, Evaluation Protocol=0-shot2026.05 | 64.5 | |
| LoRA + ISTBackbone=LLaMA3-8B2026.03 | 62.8 | |
| q*LLM Family=OLMo 2 (1B and 13B)2026.04 | 62.5 | |
| NudgingLLM Family=OLMo 2 (1B and 13B), lambda=0.42026.04 | 61.9 | |
| SFTBackbone=Llama3-8B2026.03 | 61.4 | |
| LoRABackbone=LLaMA3-8B2026.03 | 61 | |
| MDM + P2-selfModel=MDM, Parameters=1.1B, Sampling Strategy=P2-self2025.02 | 60.9 | |
| NudgingLLM Family=OLMo 2 (1B and 13B), lambda=0.32026.04 | 60.3 | |
| DataAgent_RLBackbone=LLaMA-DCLM, Reweighting Space=Data sources2025.07 | 59.24 | |
| Naive TrainingBackbone=LLaMA-DCLM, Reweighting Space=Data sources2025.07 | 59.21 | |
| CPModel Size=3B, Backbone=Qwen 2.5 3B, Algorithm=Constrained Prompting2026.02 | 59.14 | |
| Naive TrainingBackbone=LLaMA-Nemo, Reweighting Space=Data sources2025.07 | 59.05 | |
| Naive TrainingBackbone=LLaMA-FWE, Reweighting Space=Data sources2025.07 | 58.91 | |
| LLaMA2Model=LLaMA2, Parameters=7B2025.02 | 58.6 | |
| MDMModel=MDM, Parameters=1.1B, Sampling Strategy=ancestral sampling2025.02 | 58.5 | |
| Imp. rewardLLM Family=OLMo 2 (1B and 13B)2026.04 | 58.4 | |
| LoRA-GATrainable Parameters=319.81M2026.04 | 58.15 | |
| DataAgent_RLBackbone=LLaMA-FWE, Reweighting Space=Data sources2025.07 | 58.07 | |
| DataAgent_SFTBackbone=LLaMA-DCLM, Reweighting Space=Data sources2025.07 | 57.84 | |
| ChatGPTModel=ChatGPT2026.03 | 56.4 | |
| TLoRATrainable Parameters=171.71M2026.04 | 56.34 | |
| DataAgent_SFTBackbone=LLaMA-FWE, Reweighting Space=Data sources2025.07 | 56.26 | |
| DBLBackbone=LLaMA-DCLM, Reweighting Space=Data sources2025.07 | 56.22 | |
| RegMixBackbone=LLaMA-FWE, Reweighting Space=Data sources2025.07 | 55.9 | |
| RegMixBackbone=LLaMA-DCLM, Reweighting Space=Data sources2025.07 | 55.87 | |
| pLLM Family=OLMo 2 (1B and 13B)2026.04 | 54.5 | |
| CorDATrainable Parameters=319.81M2026.04 | 54.43 |