Mathematical Reasoning on AIME 24 (Pass@1 and Avg@16)
56.67Pass@1DSDR
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| DSDRModel Scale=Qwen3-4B, Max Response Length=8K tokens2026.02 | 56.67 | 52.08 | |
| DSDR w/o GDModel Scale=Qwen3-4B, Max Response Length=8K tokens2026.02 | 46.67 | 45 | |
| DSDRModel Scale=Qwen3-1.7B, Max Response Length=8K tokens2026.02 | 36.7 | 32.1 | |
| GRPOModel Scale=Qwen3-4B, Max Response Length=8K tokens2026.02 | 36.67 | 37.5 | |
| DAPOModel Scale=Qwen3-4B, Max Response Length=8K tokens2026.02 | 33.33 | 38.38 | |
| DSDR w/o GCModel Scale=Qwen3-1.7B, Max Response Length=8K tokens2026.02 | 30 | 26.5 | |
| DSDR w/o GCModel Scale=Qwen3-4B, Max Response Length=8K tokens2026.02 | 26.67 | 44.38 | |
| DSDR w/o GDModel Scale=Qwen3-1.7B, Max Response Length=8K tokens2026.02 | 23.3 | 20.6 | |
| DSDRModel Scale=Qwen2.5-math-1.5B, Max Response Length=4K tokens2026.02 | 20 | 18.8 | |
| DAPOModel Scale=Qwen3-1.7B, Max Response Length=8K tokens2026.02 | 20 | 20.4 | |
| GRPOModel Scale=Qwen2.5-math-1.5B, Max Response Length=4K tokens2026.02 | 16.7 | 15.2 | |
| GRPOModel Scale=Qwen3-1.7B, Max Response Length=8K tokens2026.02 | 16.7 | 21 | |
| BackboneModel Scale=Qwen3-4B, Max Response Length=8K tokens2026.02 | 13.33 | 20.63 | |
| DAPOModel Scale=Qwen2.5-math-1.5B, Max Response Length=4K tokens2026.02 | 13.3 | 14.4 | |
| BackboneModel Scale=Qwen3-1.7B, Max Response Length=8K tokens2026.02 | 13.3 | 10.6 | |
| BackboneModel Scale=Qwen2.5-math-1.5B, Max Response Length=4K tokens2026.02 | 10 | 3 |