Mathematical Reasoning on MATH500 (Pass@1, Avg@16)
66.2Pass@1DSDR
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| DSDRModel Scale=Qwen3-4B, Max Response Length=8K tokens2026.02 | 66.2 | 66.18 | |
| BackboneModel Scale=Qwen3-4B, Max Response Length=8K tokens2026.02 | 64.8 | 65.75 | |
| DSDRModel Scale=Qwen3-1.7B, Max Response Length=8K tokens2026.02 | 64.4 | 65.4 | |
| GRPOModel Scale=Qwen3-4B, Max Response Length=8K tokens2026.02 | 64 | 63.83 | |
| DAPOModel Scale=Qwen3-1.7B, Max Response Length=8K tokens2026.02 | 63.8 | 64 | |
| DSDR w/o GDModel Scale=Qwen3-4B, Max Response Length=8K tokens2026.02 | 63.6 | 64.74 | |
| DSDR w/o GCModel Scale=Qwen3-1.7B, Max Response Length=8K tokens2026.02 | 63 | 64.6 | |
| DSDR w/o GDModel Scale=Qwen3-1.7B, Max Response Length=8K tokens2026.02 | 61.6 | 63.5 | |
| DSDRModel Scale=Qwen2.5-math-1.5B, Max Response Length=4K tokens2026.02 | 59 | 57.5 | |
| DAPOModel Scale=Qwen3-4B, Max Response Length=8K tokens2026.02 | 59 | 62.74 | |
| DSDR w/o GCModel Scale=Qwen3-4B, Max Response Length=8K tokens2026.02 | 58 | 62.78 | |
| GRPOModel Scale=Qwen2.5-math-1.5B, Max Response Length=4K tokens2026.02 | 57.8 | 58.3 | |
| BackboneModel Scale=Qwen3-1.7B, Max Response Length=8K tokens2026.02 | 57.6 | 56.5 | |
| GRPOModel Scale=Qwen3-1.7B, Max Response Length=8K tokens2026.02 | 57.4 | 60.7 | |
| DAPOModel Scale=Qwen2.5-math-1.5B, Max Response Length=4K tokens2026.02 | 54.8 | 55.3 | |
| BackboneModel Scale=Qwen2.5-math-1.5B, Max Response Length=4K tokens2026.02 | 27.4 | 21 |