Mathematical Reasoning on TabMWP (accuracy)
97.61AccuracyZero-shot-EI
Evaluation Results
| Method | Links | |
|---|---|---|
| Zero-shot-EIModel=Gemini-1.5-Pro, Model Role=Teacher Model2026.02 | 97.61 | |
| ExGRPOModel=Qwen2.5-7B-Instruct, Model Role=Student Model, Adapter=On-Policy Adapt.2026.02 | 97.43 | |
| NPG-Muse-8BBackbone=Qwen3-8B-Base2025.08 | 97.2 | |
| ExGRPOModel=Qwen2.5-7B-Instruct, Model Role=Student Model2026.02 | 97.1 | |
| Qwen2.5-14B-Instruct-1MSize=14B, Type=Instruct, Context Length=1M2025.08 | 96.9 | |
| RevThinkModel=Qwen2.5-7B-Instruct, Model Role=Student Model2026.02 | 96.73 | |
| On-Policy DistillationModel=Qwen2.5-7B-Instruct, Model Role=Student Model2026.02 | 96.15 | |
| Answer AugModel=Qwen2.5-7B-Instruct, Model Role=Student Model2026.02 | 96.12 | |
| MOCA-AGENTMethod Category=Reinforcement learning, Backbone=Qwen3.6-27B2026.06 | 96 | |
| GPT-4Protocol=PAL, Setting=Tool manipulation2024.05 | 95.9 | |
| GPT-4 (Code Interpreter)Decoding Strategy=Greedy2024.02 | 95.9 | |
| Question AugModel=Qwen2.5-7B-Instruct, Model Role=Student Model2026.02 | 95.67 | |
| Divide-or-ConquerModel=Qwen2.5-7B-Instruct, Model Role=Student Model2026.02 | 95.62 | |
| gemma-3-12b-itBackbone=Gemma 3, RL Type=/, Supervision=/, Environment=/2026.05 | 95.2 | |
| Rephrase QuestionModel=Qwen2.5-7B-Instruct, Model Role=Student Model2026.02 | 95.12 | |
| Zero-shotModel=Gemini-1.5-Pro, Model Role=Teacher Model2026.02 | 95.1 | |
| Distill Step-by-StepModel=Qwen2.5-7B-Instruct, Model Role=Student Model2026.02 | 94.76 | |
| CREATORMethod Category=Tool-augmented / agent-based2026.06 | 94.7 | |
| SKDModel=Qwen2.5-7B-Instruct, Model Role=Student Model2026.02 | 94.17 | |
| Ori-SFTModel=Qwen2.5-Math-7B-Instruct, GSM Train Method=Ori-SFT, Evaluation Protocol=Zero-shot2025.06 | 93.9 | |
| AbstRaLModel=Qwen2.5-Math-7B-Instruct, GSM Train Method=AbstRaL, Evaluation Protocol=Zero-shot2025.06 | 93.9 | |
| Zero-shotModel=Qwen2.5-7B-Instruct, Model Role=Student Model2026.02 | 93.88 | |
| Qwen2.5-14B-InstructBackbone=Qwen 2.5, RL Type=/, Supervision=/, Environment=/2026.05 | 93.7 | |
| ChameleonMethod Category=Tool-augmented / agent-based2026.06 | 93.28 | |
| Qwen3-14B-BaseSize=14B, Type=Base2025.08 | 93.2 | |
| CoAModel=Qwen2.5-Math-7B-Instruct, GSM Train Method=CoA, Evaluation Protocol=Zero-shot2025.06 | 92.9 | |
| PoT+DocMethod Category=Tool-augmented / agent-based2026.06 | 92.69 | |
| SimpleSEBackbone=Qwen 2.5, RL Type=Offline, Supervision=No, Environment=No2026.05 | 92.3 | |
| Qwen2.5-7B-InstructBackbone=Qwen 2.5, RL Type=/, Supervision=/, Environment=/2026.05 | 91.9 | |
| ExGRPOModel=Gemma-7B-it, Model Role=Student Model, Adapter=On-Policy Adapt.2026.02 | 91.23 | |
| CoTMethod Category=Prompting / in-context learning2026.06 | 90.81 | |
| GPT-42024.05 | 90.8 | |
| ExGRPOModel=Gemma-7B-it, Model Role=Student Model2026.02 | 90.55 | |
| NPG-Muse-7BBackbone=Qwen2.5-7B-Instruct-1M2025.08 | 89.9 | |
| PoTMethod Category=Prompting / in-context learning2026.06 | 89.49 | |
| CoT-RLModel=Qwen2.5-Math-7B-Instruct, GSM Train Method=CoT-RL, Evaluation Protocol=Zero-shot2025.06 | 89.2 | |
| CRITICMethod Category=Tool-augmented / agent-based2026.06 | 89 | |
| CPMajModel=Average across models2026.04 | 88.4 | |
| CPMaxModel=Average across models2026.04 | 88.4 | |
| CPAgrModel=Average across models2026.04 | 88.4 | |
| SCCoTModel=Average across models2026.04 | 88.2 | |
| SimpleSEBackbone=Gemma 3, RL Type=Offline, Supervision=No, Environment=No2026.05 | 87.4 | |
| CoTModel=Average across models2026.04 | 87.1 | |
| SCPoTModel=Average across models2026.04 | 86.3 | |
| On-Policy DistillationModel=Gemma-7B-it, Model Role=Student Model2026.02 | 86.21 | |
| RevThinkModel=Gemma-7B-it, Model Role=Student Model2026.02 | 84.71 | |
| JiuZhang3.0Parameters=8x7B2024.05 | 84.7 | |
| gemma-3-4b-itBackbone=Gemma 3, RL Type=/, Supervision=/, Environment=/2026.05 | 84.5 | |
| Qwen3-8B-BaseSize=8B, Type=Base2025.08 | 84 | |
| ChatGPT2024.05 | 82 | |
| Qwen2.5-7B (Base) + RL w/ SIE-100%Base Model=Qwen2.5-7B (Base), Learning/Inference Strategy=RL w/ SIE-100%2025.09 | 81.8 | |
| PoTModel=Average across models2026.04 | 81.6 | |
| Qwen-1.5Parameters=110B2024.05 | 80.5 | |
| ChatGPTProtocol=PAL, Setting=Tool manipulation2024.05 | 79.9 | |
| JiuZhang3.0-8BSetting=Tool manipulation, Model Size=8B2024.05 | 79.9 | |
| JiuZhang3.0Parameters=8B2024.05 | 79.2 | |
| Base + AZR-CoderBackbone=Qwen 2.5, RL Type=Online, Supervision=No, Environment=Yes2026.05 | 78.5 | |
| Qwen2.5-7B-Instruct-1MSize=7B, Type=Instruct, Context Length=1M2025.08 | 78.4 | |
| Llama3.1-8B-Instruct + RL w/ SIE-100%Base Model=Llama3.1-8B-Instruct, Learning/Inference Strategy=RL w/ SIE-100%2025.09 | 77 | |
| JiuZhang3.0-7BSetting=Tool manipulation, Model Size=7B2024.05 | 75.6 | |
| Divide-or-ConquerModel=Gemma-7B-it, Model Role=Student Model2026.02 | 75.18 | |
| MAmmoTH2Parameters=8B, Variant=Plus2024.05 | 75.1 | |
| JiuZhang3.0Parameters=7B2024.05 | 74.8 | |
| COMTModel=QWEN3-8B, Method=COMT2026.01 | 74.3 | |
| OpenMath-CodeLlamaModel Size=70B, Base Model=CodeLlama, Decoding Strategy=Greedy2024.02 | 74.2 | |
| COMT+CCRLBackbone=QWEN3-8B2026.01 | 74.2 | |
| ToRAModel Size=70B, Base Model=Llama-2, Decoding Strategy=Greedy2024.02 | 74 | |
| FEW-SHOTBackbone=QWEN3-8B2026.01 | 73.9 | |
| QWEN3-8BModel=QWEN3-8B, Method=FEW-SHOT2026.01 | 73.9 | |
| COMTBackbone=QWEN3-8B2026.01 | 73.6 | |
| COMT+CCRLModel=QWEN3-8B, Method=COMT+CCRL2026.01 | 72.8 | |
| CoT-SFTBackbone=Qwen3-4B, Data Source=Self, Training Set=SVAMP2026.01 | 71.5 | |
| OpenMath-Llama2Model Size=70B, Base Model=Llama-2, Decoding Strategy=Greedy2024.02 | 70.8 | |
| DeepSeekMathParameters=7B, Variant=Instruct2024.05 | 70.5 | |
| ToRAModel Size=34B, Base Model=CodeLlama, Decoding Strategy=Greedy2024.02 | 70.5 | |
| FEW-SHOTBackbone=QWEN2.5-7B2026.01 | 70.4 | |
| QWEN2.5-7BModel=QWEN2.5-7B, Method=FEW-SHOT2026.01 | 70.4 | |
| Base LLMBackbone=Qwen2.5-7B, Mode=Few-shot2026.01 | 70.4 | |
| Base LLMBackbone=Qwen2.5-7B, Mode=Few-shot2026.01 | 70.4 | |
| FEW-SHOTBackbone=QWEN3-4B2026.01 | 70.3 | |
| QWEN3-4BModel=QWEN3-4B, Method=FEW-SHOT2026.01 | 70.3 | |
| Base LLMBackbone=Qwen2-1.5B, Mode=Few-shot2026.01 | 70.3 | |
| Base LLMBackbone=Qwen3-4B, Mode=Few-shot2026.01 | 70.3 | |
| FSLRBackbone=Qwen3-4B, Data Source=Self, Training Set=SVAMP2026.01 | 70.2 | |
| Rho-1-Math-7B-CodeSetting=Tool manipulation, Model Size=7B2024.05 | 70.1 | |
| OpenMath-Mistral-7BSetting=Tool manipulation, Model Size=7B, Backbone=Mistral2024.05 | 70 | |
| OpenMath-Mistral-7BModel Size=7B, Base Model=Mistral, Decoding Strategy=Greedy2024.02 | 70 | |
| CoT-SFTBackbone=LLaMA3.1-8B, Teacher Source=Qwen2026.01 | 70 | |
| ZERO-SHOTBackbone=DEEPSEEK-MATH2026.01 | 69.9 | |
| DeepSeek-MathModel=DeepSeek-Math, Method=ZERO-SHOT2026.01 | 69.9 | |
| DeepSeek-MathMode=Zero-shot2026.01 | 69.9 | |
| DeepSeek-MathBackbone=DeepSeek-Math-7B, Mode=Zero-shot2026.01 | 69.9 | |
| DeepSeekMathParameters=7B2024.05 | 69.8 | |
| COT-SFTModel=QWEN3-8B, Method=COT-SFT2026.01 | 69.7 | |
| COMT+CCRLBackbone=QWEN3-4B2026.01 | 69.6 | |
| FSLRBackbone=Qwen2-1.5B, Teacher Source=Self2026.01 | 69.6 | |
| COMT+CCRLModel=QWEN3-4B, Method=COMT+CCRL2026.01 | 69.5 | |
| Llama3.1-8B-Instruct + CoTBase Model=Llama3.1-8B-Instruct, Learning/Inference Strategy=CoT2025.09 | 69.5 | |
| FSLRBackbone=Qwen2-1.5B, Teacher Source=Qwen2026.01 | 69.1 | |
| Base + AZRBackbone=Qwen 2.5, RL Type=Online, Supervision=No, Environment=Yes2026.05 | 68.8 |