Mathematical Reasoning on Average (AIME, AIME25, AMC, HMMT25)
51.1Pass@1EKSFT
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| EKSFTBackbone=Qwen3-8B, Training Stage=Stage 2: after RL, RL Alignment=DAPO2026.05 | 51.1 | 78.3 | |
| IW-SFTBackbone=Qwen3-8B, Training Stage=Stage 2: after RL, RL Alignment=DAPO2026.05 | 49.1 | 75.1 | |
| SFTBackbone=Qwen3-8B, Training Stage=Stage 2: after RL, RL Alignment=DAPO2026.05 | 48.3 | 72.7 | |
| PSFTBackbone=Qwen3-8B, Training Stage=Stage 2: after RL, RL Alignment=DAPO2026.05 | 47.8 | 69.6 | |
| EKSFTBackbone=Qwen3-4B, Training Stage=Stage 2: after RL, RL Alignment=DAPO2026.05 | 47.4 | 75.8 | |
| BaseBackbone=Qwen3-8B, Training Stage=Stage 2: after RL, RL Alignment=DAPO2026.05 | 46.6 | 70.1 | |
| PSFTBackbone=Qwen3-4B, Training Stage=Stage 2: after RL, RL Alignment=DAPO2026.05 | 45.9 | 68.4 | |
| SFTBackbone=Qwen3-4B, Training Stage=Stage 2: after RL, RL Alignment=DAPO2026.05 | 45.8 | 70.2 | |
| IW-SFTBackbone=Qwen3-4B, Training Stage=Stage 2: after RL, RL Alignment=DAPO2026.05 | 45 | 67.9 | |
| BaseBackbone=Qwen3-4B, Training Stage=Stage 2: after RL, RL Alignment=DAPO2026.05 | 43.4 | 66.2 | |
| DFTBackbone=Qwen3-8B, Training Stage=Stage 2: after RL, RL Alignment=DAPO2026.05 | 39.9 | 65.9 | |
| DFTBackbone=Qwen3-4B, Training Stage=Stage 2: after RL, RL Alignment=DAPO2026.05 | 39.1 | 65.1 |