Mathematical Reasoning on Average
48.01Pass@1DSDR
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| DSDRModel Scale=Qwen3-4B, Max Response Length=8K tokens2026.02 | 48.01 | 46.8 | |
| DSDR w/o GDModel Scale=Qwen3-4B, Max Response Length=8K tokens2026.02 | 44.14 | 43.76 | |
| GRPOModel Scale=Qwen3-4B, Max Response Length=8K tokens2026.02 | 39.31 | 39.57 | |
| DAPOModel Scale=Qwen3-4B, Max Response Length=8K tokens2026.02 | 38.94 | 40.21 | |
| DSDRModel Scale=Qwen3-1.7B, Max Response Length=8K tokens2026.02 | 36.8 | 36.8 | |
| DSDR w/o GCModel Scale=Qwen3-1.7B, Max Response Length=8K tokens2026.02 | 35.1 | 34.9 | |
| DSDR w/o GCModel Scale=Qwen3-4B, Max Response Length=8K tokens2026.02 | 32.04 | 41.2 | |
| BackboneModel Scale=Qwen3-4B, Max Response Length=8K tokens2026.02 | 30.74 | 31.94 | |
| DSDR w/o GDModel Scale=Qwen3-1.7B, Max Response Length=8K tokens2026.02 | 29.7 | 31.4 | |
| DAPOModel Scale=Qwen3-1.7B, Max Response Length=8K tokens2026.02 | 29.6 | 32.1 | |
| GRPOModel Scale=Qwen3-1.7B, Max Response Length=8K tokens2026.02 | 28.4 | 29.7 | |
| DSDRModel Scale=Qwen2.5-math-1.5B, Max Response Length=4K tokens2026.02 | 25.4 | 25.6 | |
| BackboneModel Scale=Qwen3-1.7B, Max Response Length=8K tokens2026.02 | 24.4 | 23.4 | |
| GRPOModel Scale=Qwen2.5-math-1.5B, Max Response Length=4K tokens2026.02 | 23.2 | 24 | |
| DAPOModel Scale=Qwen2.5-math-1.5B, Max Response Length=4K tokens2026.02 | 22.7 | 22.5 | |
| BackboneModel Scale=Qwen2.5-math-1.5B, Max Response Length=4K tokens2026.02 | 11.9 | 8.2 |