Out-of-Distribution Reasoning on ARC-c, MMLU-Pro, GPQA-diamond OOD Evaluation Suite (Avg@32)
38.4ARC-c Accuracy (Avg@32)LPO
Evaluation Results
| Method | Links | ||||
|---|---|---|---|---|---|
| LPOBackbone=Qwen3-8B-Base, Training Dataset=MATH, Baseline=GRPO2026.05 | 38.4 | 53.5 | 23.7 | 38.5 | |
| LPOBackbone=Qwen3-8B-Base, Training Dataset=MATH, Baseline=Dr.GRPO2026.05 | 36.4 | 58.5 | 25.6 | 40.2 | |
| GRPOBackbone=Qwen3-8B-Base, Training Dataset=MATH2026.05 | 33.4 | 56 | 25.3 | 38.2 | |
| Dr.GRPOBackbone=Qwen3-8B-Base, Training Dataset=MATH2026.05 | 33.2 | 55.4 | 23.8 | 37.5 | |
| LPOBackbone=Qwen3-8B-Base, Training Dataset=MATH, Baseline=MaxRL2026.05 | 26.3 | 51.2 | 19.3 | 32.3 | |
| MaxRLBackbone=Qwen3-8B-Base, Training Dataset=MATH2026.05 | 22.5 | 49.8 | 18.7 | 30.3 |