Mathematical Reasoning on AIME25 (val)
11.1AccuracyPPO
Evaluation Results
| Method | Links | |
|---|---|---|
| PPOModel=Qwen3-8B-Base2025.11 | 11.1 | |
| RLOOModel=Qwen3-8B-Base2025.11 | 11.1 | |
| OBLR-POModel=Qwen3-8B-Base2025.11 | 11.1 | |
| GRPOModel=Qwen3-4B-Base2025.11 | 7.4 | |
| OBLR-POModel=Qwen3-4B-Base2025.11 | 7.4 | |
| ReMaxModel=Qwen3-8B-Base2025.11 | 7.4 | |
| PPOModel=Qwen3-4B-Base2025.11 | 3.7 | |
| ReMaxModel=Qwen3-4B-Base2025.11 | 3.7 | |
| RLOOModel=Qwen3-4B-Base2025.11 | 3.7 | |
| GRPOModel=Qwen3-8B-Base2025.11 | 3.7 |