Science Reasoning on MMLU Pro
66.49AccuracyEAPO
Evaluation Results
| Method | Links | |
|---|---|---|
| EAPOModel=Qwen-3-8B-Base2026.06 | 66.49 | |
| MOPDModel=Qwen-3-8B-Base2026.06 | 65.99 | |
| OPDModel=Qwen-3-8B-Base2026.06 | 65.91 | |
| DAPOModel=Qwen-3-8B-Base2026.06 | 65.29 | |
| GRPOModel=Qwen-3-8B-Base2026.06 | 64.71 | |
| EAPOModel=Qwen-2.5-Math-7B2026.06 | 47.57 | |
| EAPO w/o sISModel=Qwen-2.5-Math-7B2026.06 | 47.35 | |
| Trajectory ReplayModel=Qwen-2.5-Math-7B2026.06 | 46.5 | |
| DAPOModel=Qwen-2.5-Math-7B2026.06 | 44.09 | |
| MOPDModel=Qwen-2.5-Math-7B2026.06 | 43.81 | |
| OPDModel=Qwen-2.5-Math-7B2026.06 | 43.34 | |
| GRPOModel=Qwen-2.5-Math-7B2026.06 | 36.94 |