Mathematical Problem Solving on MATH Algebra (test)
98.15AccuracyAXIOM
Evaluation Results
| Method | Links | |||||||||
|---|---|---|---|---|---|---|---|---|---|---|
| AXIOMBackbone=Qwen 2.5 7B Instruct, Fine-tuning=none, Inference Path=LLM-bound2026.05 | 98.15 | 1,187 | 1,165 | 98.15 | 100 | 590 | 446 | — | — | |
| TextGrad-MOptimization Strategy=Promptwise, LMforward=GPT-4o-mini, LMbackward=GPT-4o2025.05 | 86.78 | — | — | — | — | — | — | 74.12 | 1.73 | |
| TextGrad-MOptimization Strategy=Blockwise, LMforward=GPT-4o-mini, LMbackward=GPT-4o2025.05 | 86.45 | — | — | — | — | — | — | 74.59 | 2.2 | |
| TextGradValidation Protocol=w/ val revert, LMforward=GPT-4o-mini, LMbackward=GPT-4o2025.05 | 85.42 | — | — | — | — | — | — | 72.39 | — | |
| TextGradValidation Protocol=w/o val revert, LMforward=GPT-4o-mini, LMbackward=GPT-4o2025.05 | 84.67 | — | — | — | — | — | — | 72.96 | — | |
| AdalFlow-MOptimization Strategy=Promptwise, LMforward=GPT-4o-mini, LMbackward=GPT-4o2025.05 | 82.77 | — | — | — | — | — | — | 72.63 | 0.8 | |
| AdalFlowLMforward=GPT-4o-mini, LMbackward=GPT-4o2025.05 | 81.9 | — | — | — | — | — | — | 71.83 | — | |
| GEPALMforward=GPT-4o-mini, LMbackward=GPT-4o2025.05 | 81.5 | — | — | — | — | — | — | 72.11 | — | |
| COPROLMforward=GPT-4o-mini, LMbackward=GPT-4o2025.05 | 70.84 | — | — | — | — | — | — | 67.84 | — | |
| COPRO-MOptimization Strategy=Blockwise, LMforward=GPT-4o-mini, LMbackward=GPT-4o2025.05 | 69.98 | — | — | — | — | — | — | 68.9 | 1.05 | |
| COPRO-MOptimization Strategy=Promptwise, LMforward=GPT-4o-mini, LMbackward=GPT-4o2025.05 | 68.75 | — | — | — | — | — | — | 68.79 | 0.94 |