Mathematical Reasoning on ASDiv (Accuracy)
0.955AccuracyQwen2.5-14B-Instruct-1M
Evaluation Results
| Method | Links | |
|---|---|---|
| Qwen2.5-14B-Instruct-1MSize=14B, Type=Instruct, Context Length=1M2025.08 | 0.955 | |
| Ori-SFTModel=Qwen2.5-Math-7B-Instruct, GSM Train Method=Ori-SFT, Evaluation Protocol=Zero-shot2025.06 | 0.953 | |
| AbstRaLModel=Qwen2.5-Math-7B-Instruct, GSM Train Method=AbstRaL, Evaluation Protocol=Zero-shot2025.06 | 0.953 | |
| BERT-Judgeclean_name=BERT-as-a-Judge2026.04 | 0.953 | |
| NPG-Muse-8BBackbone=Qwen3-8B-Base2025.08 | 0.952 | |
| CoAModel=Qwen2.5-Math-7B-Instruct, GSM Train Method=CoA, Evaluation Protocol=Zero-shot2025.06 | 0.951 | |
| CoT-RLModel=Qwen2.5-Math-7B-Instruct, GSM Train Method=CoT-RL, Evaluation Protocol=Zero-shot2025.06 | 0.949 | |
| Qwen2.5-7B-Instruct-1MSize=7B, Type=Instruct, Context Length=1M2025.08 | 0.947 | |
| Qwen3-14B-BaseSize=14B, Type=Base2025.08 | 0.944 | |
| eMoTModels=Qwen-32B2026.06 | 0.944 | |
| GPT-42024.05 | 0.943 | |
| NPG-Muse-7BBackbone=Qwen2.5-7B-Instruct-1M2025.08 | 0.939 | |
| JiuZhang3.0-8x7BModel Scale=8x7B2024.05 | 0.931 | |
| LEMMABackbone=Qwen2-Math-7B, # Samples=88.90k2025.03 | 0.93 | |
| BoTModels=GPT-42026.06 | 0.928 | |
| GPT-4Protocol=PAL, Setting=Tool manipulation2024.05 | 0.926 | |
| JiuZhang3.0-7BModel Scale=7B, Backbone=Mistral-7B2024.05 | 0.926 | |
| JiuZhang3.0-8BModel Scale=8B, Backbone=LLaMA-3-8B2024.05 | 0.926 | |
| GPT-4 (Code Interpreter)Decoding Strategy=Greedy2024.02 | 0.926 | |
| Qwen2-7B-SFT + Full-Step-DPOBackbone=Qwen2-7B, Training Strategy=Full-Step-DPO2025.02 | 0.924 | |
| RefAug-90kBackbone=Qwen2-Math-7B, # Samples=89.92k2025.03 | 0.924 | |
| GPTAugBackbone=Qwen2-Math-7B, # Samples=88.62k2025.03 | 0.923 | |
| MAmmoTH2-8x7B-PlusModel Scale=8x7B2024.05 | 0.922 | |
| RefAugBackbone=Qwen2-Math-7B, # Samples=29.94k2025.03 | 0.92 | |
| DeepSeekMath-7B-RLModel Scale=7B2024.05 | 0.918 | |
| Qwen2-7B-SFT + Step-DPOBackbone=Qwen2-7B, Training Strategy=Step-DPO2025.02 | 0.918 | |
| COMT+CCRLBackbone=QWEN3-4B2026.01 | 0.917 | |
| Qwen2-7B-SFTBackbone=Qwen2-7B, Training Strategy=SFT2025.02 | 0.916 | |
| DeepSeekMath-Base-SFT + Full-Step-DPOBackbone=DeepSeekMath-Base, Training Strategy=Full-Step-DPO2025.02 | 0.912 | |
| DeepSeekMath-Base-SFTBackbone=DeepSeekMath-Base, Training Strategy=SFT2025.02 | 0.91 | |
| FEW-SHOTBackbone=QWEN2.5-7B2026.01 | 0.909 | |
| COMTBackbone=QWEN3-8B2026.01 | 0.909 | |
| QWEN2.5-7BModel=QWEN2.5-7B, Method=FEW-SHOT2026.01 | 0.909 | |
| Base LLMBackbone=Qwen2.5-7B, Mode=Few-shot2026.01 | 0.909 | |
| Base LLMBackbone=Qwen2.5-7B, Mode=Few-shot2026.01 | 0.909 | |
| CoT-SFTBackbone=Qwen2-1.5B, Teacher Source=Qwen2026.01 | 0.908 | |
| FSLRBackbone=Qwen2-1.5B, Teacher Source=Qwen2026.01 | 0.908 | |
| DeepSeekMath-Base-SFT + Step-DPOBackbone=DeepSeekMath-Base, Training Strategy=Step-DPO2025.02 | 0.907 | |
| RFTBackbone=Qwen2-Math-7B, # Samples=86.52k2025.03 | 0.907 | |
| COMT+CCRLModel=QWEN3-8B, Method=COMT+CCRL2026.01 | 0.907 | |
| FSLRBackbone=Qwen2-1.5B, Teacher Source=Self2026.01 | 0.907 | |
| DeepSeekMath-Base-SFT + DPOBackbone=DeepSeekMath-Base, Training Strategy=DPO2025.02 | 0.906 | |
| FSLRBackbone=Qwen2.5-7B, Data Source=LLaMA, Training Set=SVAMP2026.01 | 0.905 | |
| MetaMathBackbone=Qwen2-Math-7B, # Samples=394.99k2025.03 | 0.904 | |
| FSLRBackbone=Qwen3-4B, Data Source=Self, Training Set=SVAMP2026.01 | 0.904 | |
| MAmmoTH2-7B-PlusModel Scale=7B2024.05 | 0.903 | |
| FSLRBackbone=Qwen3-4B, Data Source=Qwen, Training Set=SVAMP2026.01 | 0.902 | |
| DeepSeekMath-7B-InstructModel Scale=7B2024.05 | 0.901 | |
| MAmmoTH2-8B-PlusModel Scale=8B2024.05 | 0.899 | |
| COMT+CCRLModel=QWEN3-4B, Method=COMT+CCRL2026.01 | 0.899 | |
| FSLRBackbone=Qwen3-4B, Data Source=LLaMA, Training Set=SVAMP2026.01 | 0.899 | |
| CoT-SFTBackbone=Qwen3-4B, Data Source=Qwen, Training Set=SVAMP2026.01 | 0.899 | |
| COMTBackbone=QWEN3-4B2026.01 | 0.898 | |
| FEW-SHOTBackbone=QWEN3-8B2026.01 | 0.897 | |
| QWEN3-8BModel=QWEN3-8B, Method=FEW-SHOT2026.01 | 0.897 | |
| COMTModel=QWEN2.5-7B, Method=COMT2026.01 | 0.896 | |
| ISCBackbone=Qwen2-Math-7B, # Samples=86.78k2025.03 | 0.894 | |
| FSLRBackbone=Qwen2.5-7B, Teacher Source=Qwen2026.01 | 0.893 | |
| Regex2026.04 | 0.892 | |
| COMT+CCRLBackbone=QWEN3-8B2026.01 | 0.891 | |
| CoT-SFTBackbone=Qwen3-4B, Data Source=Self, Training Set=SVAMP2026.01 | 0.891 | |
| KPMath-DSMath-7BModel Scale=7B2024.05 | 0.889 | |
| COMT+CCRLBackbone=QWEN2.5-7B2026.01 | 0.888 | |
| COMT+CCRLModel=QWEN2.5-7B, Method=COMT+CCRL2026.01 | 0.888 | |
| COT-SFT+RLBackbone=QWEN2.5-7B2026.01 | 0.887 | |
| FSLRBackbone=Qwen2.5-7B, Teacher Source=LLaMA2026.01 | 0.886 | |
| FEW-SHOTBackbone=QWEN3-4B2026.01 | 0.884 | |
| COT-SFT+RLModel=QWEN2.5-7B, Method=COT-SFT+RL2026.01 | 0.884 | |
| QWEN3-4BModel=QWEN3-4B, Method=FEW-SHOT2026.01 | 0.884 | |
| Base LLMBackbone=Qwen2-1.5B, Mode=Few-shot2026.01 | 0.884 | |
| Base LLMBackbone=Qwen3-4B, Mode=Few-shot2026.01 | 0.884 | |
| JiuZhang3.0-7BSetting=Tool manipulation, Model Size=7B2024.05 | 0.883 | |
| SFTBackbone=Qwen2-Math-7B, # Samples=14.97k2025.03 | 0.881 | |
| FSLRBackbone=LLaMA3.1-8B, Teacher Source=Qwen2026.01 | 0.878 | |
| ChatGPT2024.05 | 0.877 | |
| COMTModel=QWEN3-8B, Method=COMT2026.01 | 0.876 | |
| JiuZhang3.0-8BSetting=Tool manipulation, Model Size=8B2024.05 | 0.875 | |
| COMTBackbone=QWEN2.5-7B2026.01 | 0.874 | |
| COMTModel=QWEN3-4B, Method=COMT2026.01 | 0.869 | |
| CoT-SFTBackbone=Qwen2.5-7B, Data Source=LLaMA, Training Set=SVAMP2026.01 | 0.869 | |
| ToRAModel Size=70B, Base Model=Llama-2, Decoding Strategy=Greedy2024.02 | 0.868 | |
| COT-SFTBackbone=QWEN2.5-7B2026.01 | 0.868 | |
| ElasticModel=LLaDA2.0-mini2026.05 | 0.8672 | |
| FSLRBackbone=LLaMA3.1-8B, Teacher Source=LLaMA2026.01 | 0.867 | |
| Qwen3-8B-BaseSize=8B, Type=Base2025.08 | 0.866 | |
| FSLRBackbone=Qwen2.5-7B, Data Source=Qwen, Training Set=SVAMP2026.01 | 0.865 | |
| Llama-3-8B-SFT + Full-Step-DPOBackbone=Llama-3-8B, Training Strategy=Full-Step-DPO2025.02 | 0.864 | |
| CoT-SFTBackbone=Qwen2-1.5B, Teacher Source=Self2026.01 | 0.862 | |
| BaselineModel=LLaDA2.0-mini2026.05 | 0.862 | |
| FSLRBackbone=Qwen2.5-7B, Data Source=Self, Training Set=SVAMP2026.01 | 0.86 | |
| FSLRBackbone=LLaMA3.1-8B, Data Source=LLaMA, Training Set=SVAMP2026.01 | 0.859 | |
| FEW-SHOTBackbone=LLAMA3.1-8B2026.01 | 0.858 | |
| LLAMA3.1-8BModel=LLAMA3.1-8B, Method=FEW-SHOT2026.01 | 0.858 | |
| Base LLMBackbone=LLaMA3.1-8B, Mode=Few-shot2026.01 | 0.858 | |
| Base LLMBackbone=LLaMA3.1-8B, Mode=Few-shot2026.01 | 0.858 | |
| COMT+CCRLBackbone=LLAMA3.1-8B2026.01 | 0.857 | |
| COT-SFTModel=QWEN3-4B, Method=COT-SFT2026.01 | 0.857 | |
| FSLRBackbone=Qwen2.5-7B, Teacher Source=Self2026.01 | 0.856 | |
| Rho-1-Math-7B-CodeSetting=Tool manipulation, Model Size=7B2024.05 | 0.855 | |
| ZERO-SHOTBackbone=QWEN2.5-MATH2026.01 | 0.855 |