Mathematical Reasoning on AIME 25 (pass@1, pass@32)
42.5Pass@1EKSFT
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| EKSFTBackbone=Qwen3-8B, Training Stage=Stage 2: after RL, RL Alignment=DAPO2026.05 | 42.5 | 83.3 | |
| EKSFTBackbone=Qwen3-4B, Training Stage=Stage 2: after RL, RL Alignment=DAPO2026.05 | 41.6 | 73.3 | |
| IW-SFTBackbone=Qwen3-8B, Training Stage=Stage 2: after RL, RL Alignment=DAPO2026.05 | 41 | 73.3 | |
| SFTBackbone=Qwen3-8B, Training Stage=Stage 2: after RL, RL Alignment=DAPO2026.05 | 40 | 66.7 | |
| SFTBackbone=Qwen3-4B, Training Stage=Stage 2: after RL, RL Alignment=DAPO2026.05 | 39.5 | 66.7 | |
| PSFTBackbone=Qwen3-4B, Training Stage=Stage 2: after RL, RL Alignment=DAPO2026.05 | 39.3 | 60 | |
| PSFTBackbone=Qwen3-8B, Training Stage=Stage 2: after RL, RL Alignment=DAPO2026.05 | 38.9 | 63.3 | |
| BaseBackbone=Qwen3-4B, Training Stage=Stage 2: after RL, RL Alignment=DAPO2026.05 | 37.6 | 66.7 | |
| BaseBackbone=Qwen3-8B, Training Stage=Stage 2: after RL, RL Alignment=DAPO2026.05 | 37.4 | 63.3 | |
| IW-SFTBackbone=Qwen3-4B, Training Stage=Stage 2: after RL, RL Alignment=DAPO2026.05 | 36.3 | 63.3 | |
| DFTBackbone=Qwen3-4B, Training Stage=Stage 2: after RL, RL Alignment=DAPO2026.05 | 31.5 | 63.3 | |
| DFTBackbone=Qwen3-8B, Training Stage=Stage 2: after RL, RL Alignment=DAPO2026.05 | 31.3 | 63.3 |