Mathematical Reasoning on AIME 24 (Avg@32, Pass@32)
59.5Avg@32LPOfwd
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| LPOfwdBackbone=Qwen3-8B-Base, Base Trainer=DrGRPO2026.05 | 59.5 | 19.8 | |
| LPOfwdBackbone=Qwen3-8B-Base, Base Trainer=MaxRL2026.05 | 57.6 | 21.3 | |
| DrGRPOBackbone=Qwen3-8B-Base2026.05 | 56.3 | 19.3 | |
| LPOrevBackbone=Qwen3-8B-Base, Base Trainer=DrGRPO2026.05 | 53 | 17.9 | |
| LPOrevBackbone=Qwen3-8B-Base, Base Trainer=MaxRL2026.05 | 52.6 | 22.5 | |
| GRPOBackbone=Qwen3-8B-Base2026.05 | 52.1 | 19.5 | |
| LPOfwdBackbone=Qwen3-8B-Base, Base Trainer=GRPO2026.05 | 51 | 19.1 | |
| MaxRLBackbone=Qwen3-8B-Base2026.05 | 48.6 | 18.9 | |
| LPOrevBackbone=Qwen3-8B-Base, Base Trainer=GRPO2026.05 | 45.7 | 21.6 | |
| BaseBackbone=Qwen3-8B-Base2026.05 | 39.9 | 7.9 | |
| LPOfwdBackbone=Qwen3-1.7B-Base, Base Trainer=GRPO2026.05 | 33.7 | 8.6 | |
| LPOrevBackbone=Qwen3-1.7B-Base, Base Trainer=DrGRPO2026.05 | 31.7 | 6.3 | |
| MaxRLBackbone=Qwen3-1.7B-Base2026.05 | 30.8 | 4.8 | |
| LPOfwdBackbone=Qwen3-1.7B-Base, Base Trainer=MaxRL2026.05 | 28.6 | 8.5 | |
| LPOrevBackbone=Qwen3-1.7B-Base, Base Trainer=MaxRL2026.05 | 28.3 | 7.7 | |
| LPOfwdBackbone=Qwen3-1.7B-Base, Base Trainer=DrGRPO2026.05 | 27.1 | 5.3 | |
| LPOrevBackbone=Qwen3-1.7B-Base, Base Trainer=GRPO2026.05 | 26.6 | 9.6 | |
| GRPOBackbone=Qwen3-1.7B-Base2026.05 | 26.5 | 4.2 | |
| DrGRPOBackbone=Qwen3-1.7B-Base2026.05 | 25.4 | 6.3 | |
| BaseBackbone=Qwen3-1.7B-Base2026.05 | 25 | 3.3 |