Mathematical Reasoning on AIME (pass@1, pass@32)
56.5Pass@1EKSFT
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| EKSFTBackbone=Qwen3-8B, Training Stage=Stage 2: after RL, RL Alignment=DAPO2026.05 | 56.5 | 83.3 | |
| IW-SFTBackbone=Qwen3-8B, Training Stage=Stage 2: after RL, RL Alignment=DAPO2026.05 | 54.6 | 83.3 | |
| PSFTBackbone=Qwen3-8B, Training Stage=Stage 2: after RL, RL Alignment=DAPO2026.05 | 52.8 | 73.3 | |
| SFTBackbone=Qwen3-8B, Training Stage=Stage 2: after RL, RL Alignment=DAPO2026.05 | 52.6 | 80 | |
| BaseBackbone=Qwen3-8B, Training Stage=Stage 2: after RL, RL Alignment=DAPO2026.05 | 50.6 | 73.3 | |
| EKSFTBackbone=Qwen3-4B, Training Stage=Stage 2: after RL, RL Alignment=DAPO2026.05 | 48.3 | 83.3 | |
| SFTBackbone=Qwen3-4B, Training Stage=Stage 2: after RL, RL Alignment=DAPO2026.05 | 48.1 | 80 | |
| PSFTBackbone=Qwen3-4B, Training Stage=Stage 2: after RL, RL Alignment=DAPO2026.05 | 46.3 | 76.7 | |
| IW-SFTBackbone=Qwen3-4B, Training Stage=Stage 2: after RL, RL Alignment=DAPO2026.05 | 46 | 66.7 | |
| BaseBackbone=Qwen3-4B, Training Stage=Stage 2: after RL, RL Alignment=DAPO2026.05 | 43.4 | 73.3 | |
| DFTBackbone=Qwen3-8B, Training Stage=Stage 2: after RL, RL Alignment=DAPO2026.05 | 39.5 | 76.7 | |
| DFTBackbone=Qwen3-4B, Training Stage=Stage 2: after RL, RL Alignment=DAPO2026.05 | 39.3 | 73.3 |