Mathematical Reasoning on AIME 25 (Pass@1, Avg@16)
50Pass@1DSDR
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| DSDRModel Scale=Qwen3-4B, Max Response Length=8K tokens2026.02 | 50 | 46.46 | |
| DSDR w/o GDModel Scale=Qwen3-4B, Max Response Length=8K tokens2026.02 | 43.33 | 40.42 | |
| DAPOModel Scale=Qwen3-4B, Max Response Length=8K tokens2026.02 | 40 | 33.13 | |
| GRPOModel Scale=Qwen3-4B, Max Response Length=8K tokens2026.02 | 33.33 | 35.21 | |
| DSDR w/o GCModel Scale=Qwen3-4B, Max Response Length=8K tokens2026.02 | 23.33 | 35.63 | |
| DSDR w/o GCModel Scale=Qwen3-1.7B, Max Response Length=8K tokens2026.02 | 23.3 | 24 | |
| DSDRModel Scale=Qwen3-1.7B, Max Response Length=8K tokens2026.02 | 23.2 | 27.3 | |
| GRPOModel Scale=Qwen3-1.7B, Max Response Length=8K tokens2026.02 | 20 | 15.8 | |
| BackboneModel Scale=Qwen3-4B, Max Response Length=8K tokens2026.02 | 16.67 | 16.04 | |
| DSDR w/o GDModel Scale=Qwen3-1.7B, Max Response Length=8K tokens2026.02 | 13.3 | 19 | |
| BackboneModel Scale=Qwen3-1.7B, Max Response Length=8K tokens2026.02 | 10 | 7.3 | |
| DAPOModel Scale=Qwen3-1.7B, Max Response Length=8K tokens2026.02 | 10 | 21 | |
| DAPOModel Scale=Qwen2.5-math-1.5B, Max Response Length=4K tokens2026.02 | 6.7 | 6.3 | |
| DSDRModel Scale=Qwen2.5-math-1.5B, Max Response Length=4K tokens2026.02 | 6.7 | 10.2 | |
| GRPOModel Scale=Qwen2.5-math-1.5B, Max Response Length=4K tokens2026.02 | 3.5 | 8.5 | |
| BackboneModel Scale=Qwen2.5-math-1.5B, Max Response Length=4K tokens2026.02 | 3.3 | 3 |