Mathematical Reasoning on OlympiadBench (Training Steps)
180Training Steps to Target AccuracyDIFF
Evaluation Results
| Method | Links | |
|---|---|---|
| DIFFModel=Qwen2.5-Math-7B2026.05 | 180 | |
| GRPOModel=Qwen2.5-Math-7B2026.05 | 200 | |
| SAERLGModel=Qwen2.5-Math-7B2026.05 | 200 | |
| GAINRLModel=Qwen2.5-Math-7B2026.05 | 220 | |
| SAERLDModel=Qwen2.5-Math-1.5B2026.05 | 320 | |
| SAERLGModel=Qwen2.5-Math-1.5B2026.05 | 380 | |
| DAPOModel=Qwen2.5-Math-1.5B2026.05 | 400 | |
| DIFFModel=Qwen2.5-Math-1.5B2026.05 | 420 | |
| GRPOModel=Qwen2.5-Math-1.5B2026.05 | 440 | |
| ADARFTModel=Qwen2.5-Math-7B2026.05 | 440 | |
| GAINRLModel=Qwen2.5-Math-1.5B2026.05 | 480 | |
| ADARFTModel=Qwen2.5-Math-1.5B2026.05 | 900 |