Mathematical Reasoning on Minerva (Pass@1, Avg@16)
26.84Pass@1DSDR
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| DSDRModel Scale=Qwen3-4B, Max Response Length=8K tokens2026.02 | 26.84 | 27.87 | |
| DSDR w/o GDModel Scale=Qwen3-4B, Max Response Length=8K tokens2026.02 | 26.47 | 27.44 | |
| BackboneModel Scale=Qwen3-4B, Max Response Length=8K tokens2026.02 | 26.1 | 24.61 | |
| DAPOModel Scale=Qwen3-4B, Max Response Length=8K tokens2026.02 | 25.74 | 27.37 | |
| GRPOModel Scale=Qwen3-4B, Max Response Length=8K tokens2026.02 | 25 | 23.62 | |
| DSDR w/o GCModel Scale=Qwen3-1.7B, Max Response Length=8K tokens2026.02 | 23.5 | 23.4 | |
| DSDRModel Scale=Qwen3-1.7B, Max Response Length=8K tokens2026.02 | 23.3 | 23.4 | |
| DAPOModel Scale=Qwen3-1.7B, Max Response Length=8K tokens2026.02 | 21.3 | 22.3 | |
| DSDR w/o GDModel Scale=Qwen3-1.7B, Max Response Length=8K tokens2026.02 | 20.6 | 21.4 | |
| DSDR w/o GCModel Scale=Qwen3-4B, Max Response Length=8K tokens2026.02 | 20.21 | 24.59 | |
| GRPOModel Scale=Qwen3-1.7B, Max Response Length=8K tokens2026.02 | 18.4 | 19.9 | |
| DSDRModel Scale=Qwen2.5-math-1.5B, Max Response Length=4K tokens2026.02 | 18 | 18 | |
| BackboneModel Scale=Qwen3-1.7B, Max Response Length=8K tokens2026.02 | 17.3 | 17.5 | |
| DAPOModel Scale=Qwen2.5-math-1.5B, Max Response Length=4K tokens2026.02 | 15.8 | 15.2 | |
| GRPOModel Scale=Qwen2.5-math-1.5B, Max Response Length=4K tokens2026.02 | 14 | 15 | |
| BackboneModel Scale=Qwen2.5-math-1.5B, Max Response Length=4K tokens2026.02 | 5.9 | 3.9 |