Mathematical Reasoning on MAWPS
98.5AccuracyOri-SFT
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| Ori-SFTModel=Qwen2.5-Math-7B-Instruct, GSM Train Method=Ori-SFT, Evaluation Protocol=Zero-shot2025.06 | 98.5 | — | — | |
| AbstRaLModel=Qwen2.5-Math-7B-Instruct, GSM Train Method=AbstRaL, Evaluation Protocol=Zero-shot2025.06 | 98.5 | — | — | |
| CoAModel=Qwen2.5-Math-7B-Instruct, GSM Train Method=CoA, Evaluation Protocol=Zero-shot2025.06 | 98.3 | — | — | |
| CoT-RLModel=Qwen2.5-Math-7B-Instruct, GSM Train Method=CoT-RL, Evaluation Protocol=Zero-shot2025.06 | 98.1 | — | — | |
| COMT+CCRLBackbone=QWEN3-4B2026.01 | 97.9 | — | — | |
| COMTModel=QWEN3-4B, Method=COMT2026.01 | 97.9 | — | — | |
| COMTBackbone=QWEN3-8B2026.01 | 97.8 | — | — | |
| GPT-4Protocol=PAL, Setting=Tool manipulation2024.05 | 97.7 | — | — | |
| GPT-4 (Code Interpreter)Decoding Strategy=Greedy2024.02 | 97.7 | — | — | |
| FEW-SHOTBackbone=QWEN2.5-7B2026.01 | 97.6 | — | — | |
| QWEN2.5-7BModel=QWEN2.5-7B, Method=FEW-SHOT2026.01 | 97.6 | — | — | |
| COMT+CCRLModel=QWEN3-4B, Method=COMT+CCRL2026.01 | 97.6 | — | — | |
| Base LLMBackbone=Qwen2.5-7B, Mode=Few-shot2026.01 | 97.6 | — | — | |
| Base LLMBackbone=Qwen2.5-7B, Mode=Few-shot2026.01 | 97.6 | — | — | |
| L12026.03 | 97.5 | 969 | 10.06 | |
| ROM2026.03 | 97.5 | 723 | 13.49 | |
| ROM_CSCCounterfactual Self-Correction=true2026.03 | 97.5 | 527 | 18.5 | |
| JiuZhang3.0-8BSetting=Tool manipulation, Model Size=8B2024.05 | 97.3 | — | — | |
| JiuZhang3.0-7BModel Scale=7B, Backbone=Mistral-7B2024.05 | 97.3 | — | — | |
| COMT+CCRLModel=QWEN2.5-7B, Method=COMT+CCRL2026.01 | 97.3 | — | — | |
| MAmmoTH2-8B-PlusModel Scale=8B2024.05 | 97.1 | — | — | |
| JiuZhang3.0-8BModel Scale=8B, Backbone=LLaMA-3-8B2024.05 | 97.1 | — | — | |
| MAmmoTH2-8x7B-PlusModel Scale=8x7B2024.05 | 97 | — | — | |
| FEW-SHOTBackbone=LLAMA3.1-8B2026.01 | 97 | — | — | |
| COMT+CCRLBackbone=QWEN2.5-7B2026.01 | 97 | — | — | |
| LLAMA3.1-8BModel=LLAMA3.1-8B, Method=FEW-SHOT2026.01 | 97 | — | — | |
| Base LLMBackbone=LLaMA3.1-8B, Mode=Few-shot2026.01 | 97 | — | — | |
| Base LLMBackbone=LLaMA3.1-8B, Mode=Few-shot2026.01 | 97 | — | — | |
| ChatGPT2024.05 | 96.9 | — | — | |
| COMTModel=QWEN2.5-7B, Method=COMT2026.01 | 96.8 | — | — | |
| FSLRBackbone=Qwen2-1.5B, Teacher Source=Self2026.01 | 96.8 | — | — | |
| FSLRBackbone=Qwen3-4B, Data Source=Self, Training Set=SVAMP2026.01 | 96.8 | — | — | |
| JiuZhang3.0-8x7BModel Scale=8x7B2024.05 | 96.7 | — | — | |
| COMTBackbone=QWEN3-4B2026.01 | 96.7 | — | — | |
| FSLRBackbone=Qwen2-1.5B, Teacher Source=Qwen2026.01 | 96.7 | — | — | |
| EAT2026.03 | 96.7 | 1,197 | 8.08 | |
| Vanilla2026.03 | 96.67 | 1,267 | 7.63 | |
| Cut2048max tokens=20482026.03 | 96.67 | 1,265 | 7.64 | |
| Cut1024max tokens=10242026.03 | 96.67 | 1,265 | 7.64 | |
| JiuZhang3.0-7BSetting=Tool manipulation, Model Size=7B2024.05 | 96.6 | — | — | |
| GPT-42024.05 | 96.6 | — | — | |
| FEW-SHOTBackbone=QWEN3-8B2026.01 | 96.6 | — | — | |
| QWEN3-8BModel=QWEN3-8B, Method=FEW-SHOT2026.01 | 96.6 | — | — | |
| CoT-SFTBackbone=Qwen2-1.5B, Teacher Source=Qwen2026.01 | 96.6 | — | — | |
| COMT+CCRLBackbone=QWEN3-8B2026.01 | 96.5 | — | — | |
| FSLRBackbone=Qwen3-4B, Data Source=Qwen, Training Set=SVAMP2026.01 | 96.2 | — | — | |
| CoT-SFTBackbone=Qwen3-4B, Data Source=Self, Training Set=SVAMP2026.01 | 96.2 | — | — | |
| FSLRBackbone=Qwen3-4B, Data Source=LLaMA, Training Set=SVAMP2026.01 | 96 | — | — | |
| FEW-SHOTBackbone=QWEN3-4B2026.01 | 95.9 | — | — | |
| QWEN3-4BModel=QWEN3-4B, Method=FEW-SHOT2026.01 | 95.9 | — | — | |
| Base LLMBackbone=Qwen2-1.5B, Mode=Few-shot2026.01 | 95.9 | — | — | |
| Base LLMBackbone=Qwen3-4B, Mode=Few-shot2026.01 | 95.9 | — | — | |
| Cut512max tokens=5122026.03 | 95.83 | 1,265 | 7.58 | |
| Qwen-1.5-72BModel Scale=72B2024.05 | 95.8 | — | — | |
| MAmmoTH2-7B-PlusModel Scale=7B2024.05 | 95.8 | — | — | |
| COMTModel=QWEN3-8B, Method=COMT2026.01 | 95.8 | — | — | |
| DeepSeekMath-7B-InstructModel Scale=7B2024.05 | 95.7 | — | — | |
| OpenMath-CodeLlamaModel Size=70B, Base Model=CodeLlama, Decoding Strategy=Greedy2024.02 | 95.7 | — | — | |
| OpenMath-Llama2Model Size=70B, Base Model=Llama-2, Decoding Strategy=Greedy2024.02 | 95.6 | — | — | |
| DeepSeekMath-7B-RLModel Scale=7B2024.05 | 95.5 | — | — | |
| COMT+CCRLModel=LLAMA3.1-8B, Method=COMT+CCRL2026.01 | 95.5 | — | — | |
| OpenMath-Mistral-7BSetting=Tool manipulation, Model Size=7B, Backbone=Mistral2024.05 | 95.4 | — | — | |
| OpenMath-Mistral-7BModel Size=7B, Base Model=Mistral, Decoding Strategy=Greedy2024.02 | 95.4 | — | — | |
| COMT+CCRLBackbone=LLAMA3.1-8B2026.01 | 95.4 | — | — | |
| COMTBackbone=QWEN2.5-7B2026.01 | 95.3 | — | — | |
| GPTAugBackbone=Qwen2-Math-7B, # Samples=88.62k2025.03 | 95.2 | — | — | |
| COT-SFT+RLModel=QWEN2.5-7B, Method=COT-SFT+RL2026.01 | 95.1 | — | — | |
| COMT+CCRLModel=QWEN3-8B, Method=COMT+CCRL2026.01 | 95 | — | — | |
| FSLRBackbone=LLaMA3.1-8B, Teacher Source=Self2026.01 | 95 | — | — | |
| OpenMath-CodeLlamaModel Size=34B, Base Model=CodeLlama, Decoding Strategy=Greedy2024.02 | 94.9 | — | — | |
| KPMath-DSMath-7BModel Scale=7B2024.05 | 94.8 | — | — | |
| LEMMABackbone=Qwen2-Math-7B, # Samples=88.90k2025.03 | 94.8 | — | — | |
| FSLRBackbone=Qwen2.5-7B, Data Source=LLaMA, Training Set=SVAMP2026.01 | 94.8 | — | — | |
| FSLRBackbone=Qwen2.5-7B, Teacher Source=Qwen2026.01 | 94.6 | — | — | |
| Rho-1-Math-7B-CodeSetting=Tool manipulation, Model Size=7B2024.05 | 94.5 | — | — | |
| Intern-Math-20BModel Scale=20B2024.05 | 94.4 | — | — | |
| FSLRBackbone=LLaMA3.1-8B, Data Source=LLaMA, Training Set=SVAMP2026.01 | 94.4 | — | — | |
| Qwen-1.5-110BModel Scale=110B2024.05 | 94.3 | — | — | |
| CoT-SFTBackbone=Qwen3-4B, Data Source=Qwen, Training Set=SVAMP2026.01 | 94.3 | — | — | |
| FSLRBackbone=LLaMA3.1-8B, Data Source=Qwen, Training Set=SVAMP2026.01 | 94.2 | — | — | |
| FSLRBackbone=LLaMA3.1-8B, Data Source=Self, Training Set=SVAMP2026.01 | 94.2 | — | — | |
| Llama-3-SynEevaluation_mode=Few-shot2024.07 | 94.1 | — | — | |
| FSLRBackbone=Qwen2.5-7B, Teacher Source=LLaMA2026.01 | 94.1 | — | — | |
| Rho-1-Math-7BModel Scale=7B2024.05 | 94 | — | — | |
| COMTBackbone=LLAMA3.1-8B2026.01 | 94 | — | — | |
| FSLRBackbone=Qwen2.5-7B, Data Source=Qwen, Training Set=SVAMP2026.01 | 94 | — | — | |
| Mixtral-8x7BModel Scale=8x7B2024.05 | 93.9 | — | — | |
| WizardMath-7B-1.1Model Scale=7B2024.05 | 93.8 | — | — | |
| ToRAModel Size=70B, Base Model=Llama-2, Decoding Strategy=Greedy2024.02 | 93.8 | — | — | |
| COT-SFT+RLModel=QWEN3-4B, Method=COT-SFT+RL2026.01 | 93.8 | — | — | |
| FSLRBackbone=LLaMA3.1-8B, Teacher Source=Qwen2026.01 | 93.8 | — | — | |
| MetaMath-Mistral-7BModel Scale=7B2024.05 | 93.7 | — | — | |
| COT-SFT+RLBackbone=QWEN3-4B2026.01 | 93.7 | — | — | |
| COT-SFTModel=QWEN3-4B, Method=COT-SFT2026.01 | 93.7 | — | — | |
| OpenMath-CodeLlamaModel Size=13B, Base Model=CodeLlama, Decoding Strategy=Greedy2024.02 | 93.6 | — | — | |
| Abel-7B-002Model Scale=7B2024.05 | 93.5 | — | — | |
| OpenMath-CodeLlamaModel Size=7B, Base Model=CodeLlama, Decoding Strategy=Greedy2024.02 | 93.5 | — | — | |
| COMTModel=LLAMA3.1-8B, Method=COMT2026.01 | 93.5 | — | — | |
| DeepSeek-Coder-BaseSize=33B, Protocol=Program-Aided Math Reasoning (PAL)2024.01 | 93.3 | — | — | |
| ToRAModel Size=34B, Base Model=CodeLlama, Decoding Strategy=Greedy2024.02 | 93.3 | — | — |