Mathematical Reasoning on GSM8K (Training Steps Efficiency)
160Training Steps to Target AccuracyDIFF
Evaluation Results
| Method | Links | |
|---|---|---|
| DIFFModel=Qwen2.5-Math-7B2026.05 | 160 | |
| SAERLGModel=Qwen2.5-Math-7B2026.05 | 200 | |
| GAINRLModel=Qwen2.5-Math-7B2026.05 | 220 | |
| SAERLDModel=Qwen2.5-Math-1.5B2026.05 | 240 | |
| GRPOModel=Qwen2.5-Math-7B2026.05 | 240 | |
| DAPOModel=Qwen2.5-Math-1.5B2026.05 | 320 | |
| ADARFTModel=Qwen2.5-Math-7B2026.05 | 360 | |
| SAERLGModel=Qwen2.5-Math-1.5B2026.05 | 400 | |
| DIFFModel=Qwen2.5-Math-1.5B2026.05 | 440 | |
| GRPOModel=Qwen2.5-Math-1.5B2026.05 | 540 | |
| GAINRLModel=Qwen2.5-Math-1.5B2026.05 | 780 | |
| ADARFTModel=Qwen2.5-Math-1.5B2026.05 | 900 |