Mathematical Reasoning on Olympiad (Pass@1, Avg@16)
40.65Pass@1DSDR w/o GD
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| DSDR w/o GDModel Scale=Qwen3-4B, Max Response Length=8K tokens2026.02 | 40.65 | 41.2 | |
| DSDRModel Scale=Qwen3-4B, Max Response Length=8K tokens2026.02 | 40.36 | 42.43 | |
| GRPOModel Scale=Qwen3-4B, Max Response Length=8K tokens2026.02 | 37.54 | 37.7 | |
| DAPOModel Scale=Qwen3-4B, Max Response Length=8K tokens2026.02 | 36.65 | 39.42 | |
| DSDRModel Scale=Qwen3-1.7B, Max Response Length=8K tokens2026.02 | 36.4 | 36 | |
| DSDR w/o GCModel Scale=Qwen3-1.7B, Max Response Length=8K tokens2026.02 | 35.9 | 36.1 | |
| DSDR w/o GCModel Scale=Qwen3-4B, Max Response Length=8K tokens2026.02 | 33.98 | 40.6 | |
| DAPOModel Scale=Qwen3-1.7B, Max Response Length=8K tokens2026.02 | 32.9 | 32.9 | |
| BackboneModel Scale=Qwen3-4B, Max Response Length=8K tokens2026.02 | 32.79 | 32.69 | |
| DSDR w/o GDModel Scale=Qwen3-1.7B, Max Response Length=8K tokens2026.02 | 29.8 | 32.5 | |
| GRPOModel Scale=Qwen3-1.7B, Max Response Length=8K tokens2026.02 | 29.5 | 31.2 | |
| GRPOModel Scale=Qwen2.5-math-1.5B, Max Response Length=4K tokens2026.02 | 24 | 22.9 | |
| BackboneModel Scale=Qwen3-1.7B, Max Response Length=8K tokens2026.02 | 23.7 | 25.3 | |
| DSDRModel Scale=Qwen2.5-math-1.5B, Max Response Length=4K tokens2026.02 | 23.1 | 23.7 | |
| DAPOModel Scale=Qwen2.5-math-1.5B, Max Response Length=4K tokens2026.02 | 22.7 | 21.4 | |
| BackboneModel Scale=Qwen2.5-math-1.5B, Max Response Length=4K tokens2026.02 | 13.1 | 9.9 |