Mathematical Reasoning on AIME 2025 (p@1, p@10, p@100)
58.7Precision@1Power asym (2,2)
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| Power asym (2,2)Model=CWM 32B, Training Budget=30k2026.07 | 58.7 | 78.1 | 83.3 | |
| Asym FADEModel=CWM 32B, Training Budget=30k, h*=1.02026.07 | 52.7 | 78.5 | 83.1 | |
| GRPOModel=CWM 32B, Training Budget=30k2026.07 | 46.1 | 77.2 | 80 | |
| FADEModel=Qwen 2.5 7B, Training Budget=14k, h*=1.32026.07 | 31.3 | 55.4 | 70.7 | |
| FADEModel=Qwen 2.5 7B, Training Budget=14k, h*=1.02026.07 | 28.6 | 53.8 | 68.3 | |
| FADEModel=Qwen 2.5 7B, Training Budget=14k, h*=0.52026.07 | 27.8 | 52.9 | 67.5 | |
| Implicit p@8Model=Qwen 2.5 7B, Training Budget=14k2026.07 | 27.5 | 52.5 | 69.1 | |
| Asym. normModel=Qwen 2.5 7B, Training Budget=14k2026.07 | 27.5 | 52 | 63.3 | |
| Power α asym (2,2)Model=Qwen 2.5 7B, Training Budget=14k2026.07 | 27.4 | 53.3 | 66.6 | |
| Power α = 2Model=CWM 32B, Training Budget=30k2026.07 | 27.4 | 70.4 | 84.6 | |
| Asym. GRPOModel=Qwen 2.5 7B, Training Budget=14k, delta=0.52026.07 | 26.6 | 48.3 | 66 | |
| Power α = 2Model=Qwen 2.5 7B, Training Budget=14k2026.07 | 26.6 | 50 | 64.9 | |
| LMEModel=Qwen 2.5 7B, Training Budget=14k, beta=0.42026.07 | 25.4 | 51 | 72.5 | |
| Implicit p@2Model=Qwen 2.5 7B, Training Budget=14k2026.07 | 24.9 | 45 | 63.7 | |
| GRPOModel=Qwen 2.5 7B, Training Budget=14k2026.07 | 24.6 | 50.3 | 68.3 | |
| Pass@8Model=Qwen 2.5 7B, Training Budget=14k2026.07 | 24.4 | 49.3 | 70.4 | |
| SFT baselineModel=Qwen 2.5 7B, Training Budget=14k2026.07 | 21.3 | 46.2 | 70.8 |