Scientific Reasoning on SciBench (Pass@1)
29.64Pass@1MAPR
Evaluation Results
| Method | Links | |
|---|---|---|
| MAPRBase Model=Qwen3-14B-Base2025.09 | 29.64 | |
| GRPOBase Model=Qwen3-14B-Base2025.09 | 28.33 | |
| Mathstral-7B-v0.1 + GRPO w/ VERL.Base Model=Mathstral-7B-v0.1, Training=GRPO w/ VERL.2025.09 | 27.9 | |
| Mathstral-7B-v0.1 + PPO w/ VERL.Base Model=Mathstral-7B-v0.1, Training=PPO w/ VERL.2025.09 | 23 | |
| Qwen2.5-7B + PPO w/ VERL.Base Model=Qwen2.5-7B, Training=PPO w/ VERL.2025.09 | 23 | |
| Qwen2.5-7B + GRPO w/ VERL.Base Model=Qwen2.5-7B, Training=GRPO w/ VERL.2025.09 | 22.8 | |
| Mathstral-7B-v0.1 + GRPOBase Model=Mathstral-7B-v0.1, Training=GRPO2025.09 | 22.4 | |
| Mathstral-7B-v0.1 + PPOBase Model=Mathstral-7B-v0.1, Training=PPO2025.09 | 22.1 | |
| Qwen2.5-7B + PPOBase Model=Qwen2.5-7B, Training=PPO2025.09 | 22.1 | |
| Qwen2.5-7B + GRPOBase Model=Qwen2.5-7B, Training=GRPO2025.09 | 21.5 | |
| Mathstral-7B-v0.1Base Model=Mathstral-7B-v0.12025.09 | 15.8 | |
| Qwen2.5-7BBase Model=Qwen2.5-7B2025.09 | 15.8 |