Mathematical Reasoning on HMMT25 (pass@1, pass@32)
23.3Pass@1EKSFT
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| EKSFTBackbone=Qwen3-8B, Training Stage=Stage 2: after RL, RL Alignment=DAPO2026.05 | 23.3 | 50 | |
| IW-SFTBackbone=Qwen3-4B, Training Stage=Stage 2: after RL, RL Alignment=DAPO2026.05 | 21.4 | 50 | |
| EKSFTBackbone=Qwen3-4B, Training Stage=Stage 2: after RL, RL Alignment=DAPO2026.05 | 21.4 | 50 | |
| PSFTBackbone=Qwen3-4B, Training Stage=Stage 2: after RL, RL Alignment=DAPO2026.05 | 20 | 46.7 | |
| SFTBackbone=Qwen3-8B, Training Stage=Stage 2: after RL, RL Alignment=DAPO2026.05 | 20 | 50 | |
| IW-SFTBackbone=Qwen3-8B, Training Stage=Stage 2: after RL, RL Alignment=DAPO2026.05 | 20 | 50 | |
| BaseBackbone=Qwen3-8B, Training Stage=Stage 2: after RL, RL Alignment=DAPO2026.05 | 19.6 | 53.3 | |
| SFTBackbone=Qwen3-4B, Training Stage=Stage 2: after RL, RL Alignment=DAPO2026.05 | 19.4 | 40 | |
| PSFTBackbone=Qwen3-8B, Training Stage=Stage 2: after RL, RL Alignment=DAPO2026.05 | 18.6 | 50 | |
| BaseBackbone=Qwen3-4B, Training Stage=Stage 2: after RL, RL Alignment=DAPO2026.05 | 17.8 | 33.3 | |
| DFTBackbone=Qwen3-8B, Training Stage=Stage 2: after RL, RL Alignment=DAPO2026.05 | 16.9 | 33.3 | |
| DFTBackbone=Qwen3-4B, Training Stage=Stage 2: after RL, RL Alignment=DAPO2026.05 | 13.7 | 33.3 |