Mathematical Reasoning on Olympiad (Avg@4, Pass@4)
55.8Avg@4LPOfwd
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| LPOfwdBackbone=Qwen3-8B-Base, Base Trainer=GRPO2026.05 | 55.8 | 42.3 | |
| LPOrevBackbone=Qwen3-8B-Base, Base Trainer=MaxRL2026.05 | 55.8 | 45.3 | |
| DrGRPOBackbone=Qwen3-8B-Base2026.05 | 54.7 | 42.2 | |
| LPOfwdBackbone=Qwen3-8B-Base, Base Trainer=MaxRL2026.05 | 54.5 | 44.8 | |
| LPOrevBackbone=Qwen3-8B-Base, Base Trainer=GRPO2026.05 | 53.9 | 41.1 | |
| MaxRLBackbone=Qwen3-8B-Base2026.05 | 53.6 | 42.6 | |
| GRPOBackbone=Qwen3-8B-Base2026.05 | 51.9 | 40.4 | |
| LPOfwdBackbone=Qwen3-8B-Base, Base Trainer=DrGRPO2026.05 | 51.6 | 42.6 | |
| LPOrevBackbone=Qwen3-8B-Base, Base Trainer=DrGRPO2026.05 | 51 | 42 | |
| LPOfwdBackbone=Qwen3-1.7B-Base, Base Trainer=GRPO2026.05 | 38.1 | 29.9 | |
| LPOfwdBackbone=Qwen3-1.7B-Base, Base Trainer=MaxRL2026.05 | 37.5 | 30.5 | |
| LPOrevBackbone=Qwen3-1.7B-Base, Base Trainer=GRPO2026.05 | 37.1 | 29.2 | |
| LPOrevBackbone=Qwen3-1.7B-Base, Base Trainer=DrGRPO2026.05 | 36.7 | 28.6 | |
| LPOfwdBackbone=Qwen3-1.7B-Base, Base Trainer=DrGRPO2026.05 | 36.5 | 28.3 | |
| DrGRPOBackbone=Qwen3-1.7B-Base2026.05 | 36.1 | 29.8 | |
| LPOrevBackbone=Qwen3-1.7B-Base, Base Trainer=MaxRL2026.05 | 35.8 | 28.8 | |
| MaxRLBackbone=Qwen3-1.7B-Base2026.05 | 35.3 | 28.6 | |
| BaseBackbone=Qwen3-8B-Base2026.05 | 33.7 | 31.7 | |
| GRPOBackbone=Qwen3-1.7B-Base2026.05 | 33.5 | 29.8 | |
| BaseBackbone=Qwen3-1.7B-Base2026.05 | 21.2 | 21.2 |