Mathematical Problem Solving on Gaokao MathQA
86.3AccuracyQwen2.5-Math-72B
Evaluation Results
| Method | Links | |
|---|---|---|
| Qwen2.5-Math-72Bshot=4-shot, prompting=few-shot chain-of-thought2024.09 | 86.3 | |
| TextGradBackbone=Qwen3-8B2026.03 | 78.5 | |
| MemAPOBackbone=Qwen3-8B2026.03 | 76.9 | |
| PromptBreederBackbone=Qwen3-8B2026.03 | 76.6 | |
| ProTeGiBackbone=Qwen3-8B2026.03 | 74.5 | |
| Qwen2-72Bshot=4-shot, prompting=few-shot chain-of-thought2024.09 | 72.6 | |
| RaRBackbone=Qwen3-8B2026.03 | 70.1 | |
| Qwen2-Math-72Bshot=4-shot, prompting=few-shot chain-of-thought2024.09 | 69.5 | |
| Qwen2.5-Math-7Bshot=4-shot, prompting=few-shot chain-of-thought2024.09 | 69.5 | |
| IOBackbone=Qwen3-8B2026.03 | 68.5 | |
| CoTBackbone=Qwen3-8B2026.03 | 65.7 | |
| Step-BackBackbone=Qwen3-8B2026.03 | 64.5 | |
| OPROBackbone=Qwen3-8B2026.03 | 63.3 | |
| MemAPOBackbone=GPT-4o-mini2026.03 | 62.2 | |
| MemAPOBackbone=GPT-4o-mini2026.03 | 61.8 | |
| TextGradBackbone=GPT-4o-mini2026.03 | 59 | |
| Qwen2-Math-7Bshot=4-shot, prompting=few-shot chain-of-thought2024.09 | 57.3 | |
| OPROBackbone=GPT-4o-mini2026.03 | 56.2 | |
| TextGradBackbone=GPT-4o-mini2026.03 | 56.2 | |
| Qwen2.5-Math-1.5Bshot=4-shot, prompting=few-shot chain-of-thought2024.09 | 54.1 | |
| Qwen2-7Bshot=4-shot, prompting=few-shot chain-of-thought2024.09 | 51.6 | |
| DeepSeek-Coder-V2-Lite-Baseshot=4-shot, prompting=few-shot chain-of-thought2024.09 | 51.3 | |
| MathCoder-VL-8B#Params=8B2025.05 | 51.2 | |
| SPOBackbone=Qwen3-8B2026.03 | 51 | |
| Qwen2-Math-1.5Bshot=4-shot, prompting=few-shot chain-of-thought2024.09 | 50.7 | |
| GPT-4-turbo#Params=-2025.05 | 50 | |
| OPROBackbone=GPT-4o-mini2026.03 | 49.4 | |
| SPOBackbone=GPT-4o-mini2026.03 | 47 | |
| PromptBreederBackbone=GPT-4o-mini2026.03 | 46.6 | |
| GPT-4V#Params=-2025.05 | 45 | |
| ProTeGiBackbone=GPT-4o-mini2026.03 | 45 | |
| ProTeGiBackbone=GPT-4o-mini2026.03 | 45 | |
| Llama-3.1-70Bshot=4-shot, prompting=few-shot chain-of-thought2024.09 | 43.3 | |
| StepBackBackbone=GPT-4o-mini2026.03 | 41.8 | |
| Step-BackBackbone=GPT-4o-mini2026.03 | 41.8 | |
| InternVL2-76B#Params=76B2025.05 | 41.2 | |
| DeepSeekMath-Base-7Bshot=4-shot, prompting=few-shot chain-of-thought2024.09 | 40.7 | |
| InternLM2-Math-Base-20Bshot=4-shot, prompting=few-shot chain-of-thought2024.09 | 40.2 | |
| IOBackbone=GPT-4o-mini2026.03 | 39.4 | |
| IOBackbone=GPT-4o-mini2026.03 | 39.4 | |
| RephraseBackbone=GPT-4o-mini2026.03 | 38.6 | |
| RaRBackbone=GPT-4o-mini2026.03 | 38.6 | |
| MathCoder-VL-2B#Params=2B2025.05 | 37.5 | |
| PromptBreederBackbone=GPT-4o-mini2026.03 | 37.5 | |
| SPOBackbone=GPT-4o-mini2026.03 | 35.9 | |
| Qwen2-1.5Bshot=4-shot, prompting=few-shot chain-of-thought2024.09 | 35.6 | |
| CoTBackbone=GPT-4o-mini2026.03 | 35.5 | |
| CoTBackbone=GPT-4o-mini2026.03 | 35.5 | |
| DeepSeekMath-BaseSize=7B, Evaluation=Chain-of-thought prompting, Source=Open-Source Base Model2024.02 | 35.3 | |
| Qwen-VL-Plus#Params=-2025.05 | 33.8 | |
| InternVL2-26B#Params=26B2025.05 | 33.4 | |
| InternVL2-8B#Params=8B2025.05 | 32.5 | |
| Llama-3.1-8Bshot=4-shot, prompting=few-shot chain-of-thought2024.09 | 28.5 | |
| LlemmaSize=34B, Evaluation=Chain-of-thought prompting, Source=Open-Source Base Model2024.02 | 26.2 | |
| Qwen2-VL#Params=8B2025.05 | 25 | |
| LlemmaSize=7B, Evaluation=Chain-of-thought prompting, Source=Open-Source Base Model2024.02 | 23.6 | |
| MistralSize=7B, Evaluation=Chain-of-thought prompting, Source=Open-Source Base Model2024.02 | 23.4 | |
| Deepseek-VL#Params=8B2025.05 | 20 | |
| InternVL-Chat-2B-V1-5#Params=2B2025.05 | 17.5 | |
| LLaVA-1.5-13B#Params=13B2025.05 | 16.3 |