Mathematical Reasoning on AMC '23 (Accuracy, Speedup)
75AccuracyDAPO
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| DAPOModel=Qwen-3-1.7B-Base2026.03 | 75 | — | |
| ARROLModel=Qwen-3-1.7B-Base, Base Method=DAPO2026.03 | 72.5 | 1.7 | |
| Teacher-OPPOBackbone=Phi-4-mini, Training Framework=DeepScaleR2026.05 | 43.5 | — | |
| DAPO + OPPOBackbone=Phi-4-mini, Training Framework=DeepScaleR2026.05 | 43 | — | |
| Self-OPPOBackbone=Phi-4-mini, Training Framework=DeepScaleR2026.05 | 41.5 | — | |
| Dr.GRPO + OPPOBackbone=Phi-4-mini, Training Framework=DeepScaleR2026.05 | 40.8 | — | |
| SDPOBackbone=Phi-4-mini, Training Framework=DeepScaleR2026.05 | 38 | — | |
| DAPOBackbone=Phi-4-mini, Training Framework=DeepScaleR2026.05 | 37.5 | — | |
| Dr.GRPOBackbone=Phi-4-mini, Training Framework=DeepScaleR2026.05 | 35.2 | — | |
| GRPOBackbone=Phi-4-mini, Training Framework=DeepScaleR2026.05 | 35 | — | |
| Base modelBackbone=Phi-4-mini, Training Framework=DeepScaleR2026.05 | 22 | — |