Mathematical Reasoning on AIME 2024 (p@1, p@10, p@100)
70.3P@1Power asym (2,2)
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| Power asym (2,2)Model=CWM 32B, Training Budget=30k2026.07 | 70.3 | 89.2 | 93.3 | |
| Asym FADEModel=CWM 32B, Training Budget=30k, h*=1.02026.07 | 64.6 | 89.5 | 93.3 | |
| GRPOModel=CWM 32B, Training Budget=30k2026.07 | 58.4 | 87.4 | 94.9 | |
| FADEModel=Qwen 2.5 7B, Training Budget=14k, h*=1.02026.07 | 44.5 | 72.3 | 83.7 | |
| FADEModel=Qwen 2.5 7B, Training Budget=14k, h*=1.32026.07 | 44.3 | 71.8 | 80.8 | |
| Asym. GRPOModel=Qwen 2.5 7B, Training Budget=14k, delta=0.52026.07 | 43.1 | 69.1 | 79.2 | |
| FADEModel=Qwen 2.5 7B, Training Budget=14k, h*=0.52026.07 | 41.9 | 70.9 | 79.6 | |
| Power α = 2Model=Qwen 2.5 7B, Training Budget=14k2026.07 | 41.8 | 70.4 | 77.9 | |
| Power α = 2Model=CWM 32B, Training Budget=30k2026.07 | 41.2 | 81.9 | 91.7 | |
| Power α asym (2,2)Model=Qwen 2.5 7B, Training Budget=14k2026.07 | 41.1 | 71.9 | 86.1 | |
| Implicit p@8Model=Qwen 2.5 7B, Training Budget=14k2026.07 | 40.3 | 69.6 | 76.7 | |
| Asym. normModel=Qwen 2.5 7B, Training Budget=14k2026.07 | 40.2 | 69.1 | 78.3 | |
| LMEModel=Qwen 2.5 7B, Training Budget=14k, beta=0.42026.07 | 39.3 | 71 | 82.4 | |
| GRPOModel=Qwen 2.5 7B, Training Budget=14k2026.07 | 37.9 | 70.4 | 81.4 | |
| Implicit p@2Model=Qwen 2.5 7B, Training Budget=14k2026.07 | 36 | 66.1 | 73.3 | |
| Pass@8Model=Qwen 2.5 7B, Training Budget=14k2026.07 | 35.7 | 68 | 82.1 | |
| SFT baselineModel=Qwen 2.5 7B, Training Budget=14k2026.07 | 32.6 | 65.3 | 78.1 |