Mathematical Reasoning on Minerva (pass@32, Avg@32)
52.3Average Score (@32)LPOfwd
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| LPOfwdBackbone=Qwen3-8B-Base, Base Trainer=MaxRL2026.05 | 52.3 | 69 | |
| LPOrevBackbone=Qwen3-8B-Base, Base Trainer=MaxRL2026.05 | 52.3 | 70.1 | |
| MaxRLBackbone=Qwen3-8B-Base2026.05 | 48.9 | 66 | |
| DrGRPOBackbone=Qwen3-8B-Base2026.05 | 48.4 | 67.7 | |
| LPOfwdBackbone=Qwen3-8B-Base, Base Trainer=GRPO2026.05 | 48.3 | 69.1 | |
| LPOfwdBackbone=Qwen3-8B-Base, Base Trainer=DrGRPO2026.05 | 48.3 | 70.2 | |
| LPOrevBackbone=Qwen3-8B-Base, Base Trainer=DrGRPO2026.05 | 47.8 | 64.9 | |
| LPOrevBackbone=Qwen3-8B-Base, Base Trainer=GRPO2026.05 | 46.9 | 67 | |
| GRPOBackbone=Qwen3-8B-Base2026.05 | 46.1 | 63.8 | |
| BaseBackbone=Qwen3-8B-Base2026.05 | 44.1 | 46.5 | |
| LPOrevBackbone=Qwen3-1.7B-Base, Base Trainer=DrGRPO2026.05 | 38.1 | 45.6 | |
| LPOfwdBackbone=Qwen3-1.7B-Base, Base Trainer=GRPO2026.05 | 37.5 | 50.1 | |
| GRPOBackbone=Qwen3-1.7B-Base2026.05 | 37.2 | 45.4 | |
| MaxRLBackbone=Qwen3-1.7B-Base2026.05 | 36.9 | 42.4 | |
| DrGRPOBackbone=Qwen3-1.7B-Base2026.05 | 36.8 | 43.3 | |
| LPOfwdBackbone=Qwen3-1.7B-Base, Base Trainer=DrGRPO2026.05 | 36.5 | 46.2 | |
| LPOrevBackbone=Qwen3-1.7B-Base, Base Trainer=GRPO2026.05 | 36.4 | 47 | |
| LPOfwdBackbone=Qwen3-1.7B-Base, Base Trainer=MaxRL2026.05 | 36.4 | 49.9 | |
| LPOrevBackbone=Qwen3-1.7B-Base, Base Trainer=MaxRL2026.05 | 36.3 | 46.1 | |
| BaseBackbone=Qwen3-1.7B-Base2026.05 | 32.8 | 30 |