Mathematical Reasoning on AMC 23 (Avg@32, pass@32)
95.1Avg@32LPOfwd
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| LPOfwdBackbone=Qwen3-8B-Base, Base Trainer=GRPO2026.05 | 95.1 | 29.3 | |
| LPOfwdBackbone=Qwen3-8B-Base, Base Trainer=MaxRL2026.05 | 94.5 | 23.9 | |
| MaxRLBackbone=Qwen3-8B-Base2026.05 | 93.4 | 23.9 | |
| LPOrevBackbone=Qwen3-8B-Base, Base Trainer=GRPO2026.05 | 93.1 | 23.3 | |
| LPOrevBackbone=Qwen3-8B-Base, Base Trainer=MaxRL2026.05 | 92.5 | 22.5 | |
| LPOfwdBackbone=Qwen3-8B-Base, Base Trainer=DrGRPO2026.05 | 91.5 | 25.6 | |
| LPOrevBackbone=Qwen3-8B-Base, Base Trainer=DrGRPO2026.05 | 91.4 | 26 | |
| DrGRPOBackbone=Qwen3-8B-Base2026.05 | 89.7 | 24.9 | |
| LPOfwdBackbone=Qwen3-1.7B-Base, Base Trainer=MaxRL2026.05 | 85.5 | 11.8 | |
| BaseBackbone=Qwen3-8B-Base2026.05 | 84.3 | 12.1 | |
| GRPOBackbone=Qwen3-1.7B-Base2026.05 | 83.7 | 10.8 | |
| LPOfwdBackbone=Qwen3-1.7B-Base, Base Trainer=GRPO2026.05 | 83.4 | 13.2 | |
| LPOrevBackbone=Qwen3-1.7B-Base, Base Trainer=GRPO2026.05 | 83.1 | 13.9 | |
| LPOrevBackbone=Qwen3-1.7B-Base, Base Trainer=MaxRL2026.05 | 82.6 | 10.7 | |
| BaseBackbone=Qwen3-1.7B-Base2026.05 | 79.3 | 3.4 | |
| GRPOBackbone=Qwen3-8B-Base2026.05 | 79.1 | 24 | |
| MaxRLBackbone=Qwen3-1.7B-Base2026.05 | 79 | 10.6 | |
| LPOrevBackbone=Qwen3-1.7B-Base, Base Trainer=DrGRPO2026.05 | 78.9 | 10.3 | |
| DrGRPOBackbone=Qwen3-1.7B-Base2026.05 | 76.2 | 8.5 | |
| LPOfwdBackbone=Qwen3-1.7B-Base, Base Trainer=DrGRPO2026.05 | 75.9 | 10.3 |