Mathematical Reasoning on AIME 2025 (Reward-weighted Pass@1)
4.3Reward-weighted Pass@1AIRL (Interval)
Evaluation Results
| Method | Links | |
|---|---|---|
| AIRL (Interval)Model=Qwen2.5-7B2025.10 | 4.3 | |
| AIRL (Sparse)Model=Qwen2.5-7B2025.10 | 3.82 | |
| SFTModel=Qwen2.5-7B2025.10 | 3.12 | |
| AIRL (Step-wise)Model=Qwen2.5-7B2025.10 | 2.82 | |
| AIRL (Dense)Model=Qwen2.5-7B2025.10 | 2.17 | |
| AIRL (Sparse)Model=Qwen2.5-3B2025.10 | 1.67 | |
| SFTModel=Qwen2.5-3B2025.10 | 1.42 | |
| AIRL (Step-wise)Model=Qwen2.5-3B2025.10 | 0.84 | |
| AIRL (Interval)Model=Qwen2.5-3B2025.10 | 0.36 | |
| AIRL (Dense)Model=Qwen2.5-3B2025.10 | 0.36 |