Training Efficiency on AIME 24 (Training Steps)
20Training StepsDAPO
Evaluation Results
| Method | Links | |
|---|---|---|
| DAPOModel=Qwen2.5-Math-1.5B2026.05 | 20 | |
| SAERLGModel=Qwen2.5-Math-1.5B2026.05 | 20 | |
| SAERLDModel=Qwen2.5-Math-1.5B2026.05 | 20 | |
| DIFFModel=Qwen2.5-Math-7B2026.05 | 20 | |
| ADARFTModel=Qwen2.5-Math-7B2026.05 | 20 | |
| GRPOModel=Qwen2.5-Math-1.5B2026.05 | 40 | |
| ADARFTModel=Qwen2.5-Math-1.5B2026.05 | 40 | |
| GAINRLModel=Qwen2.5-Math-1.5B2026.05 | 40 | |
| GRPOModel=Qwen2.5-Math-7B2026.05 | 40 | |
| SAERLGModel=Qwen2.5-Math-7B2026.05 | 40 | |
| DIFFModel=Qwen2.5-Math-1.5B2026.05 | 60 | |
| GAINRLModel=Qwen2.5-Math-7B2026.05 | 80 |