Mathematical Reasoning on MATH-500 and AIME2024
80.8Micro Avg. AccuracyPROMPTCOT
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| PROMPTCOTFine-tuned Model=Qwen2.5-Math-7B, Training Dataset=PROMPTCOT2025.03 | 80.8 | 1.2 | |
| NuminaMathFine-tuned Model=Qwen2.5-Math-7B, Training Dataset=NuminaMath2025.03 | 76.6 | -3 | |
| OpenMathInstructFine-tuned Model=Qwen2.5-Math-7B, Training Dataset=OpenMathInstruct2025.03 | 75.8 | -3.8 | |
| Evol-InstructFine-tuned Model=Qwen2.5-Math-7B, Training Dataset=Evol-Instruct2025.03 | 74 | -5.6 | |
| KPDDSFine-tuned Model=Qwen2.5-Math-7B, Training Dataset=KPDDS2025.03 | 72.3 | -7.3 |