General Knowledge Reasoning on MMLU-Pro (Acc, Ent)
75.41Accuracy (MMLU-Pro)Policy Split
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| Policy SplitBackbone=Qwen3-8B2026.04 | 75.41 | 0.85 | |
| GRPOBackbone=Qwen3-8B2026.04 | 75.36 | 0.54 | |
| GRPO w/ Clip-CovBackbone=Qwen3-8B2026.04 | 75.16 | 0.54 | |
| GRPO w/ Forking Token OnlyBackbone=Qwen3-8B2026.04 | 75.05 | 0.54 | |
| GRPO w/ Ent AdvantageBackbone=Qwen3-8B2026.04 | 74.84 | 0.72 | |
| GRPO w/ Ent RegularizationBackbone=Qwen3-8B2026.04 | 74.42 | 0.66 | |
| OriginalBackbone=Qwen3-8B2026.04 | 74.38 | 0.56 | |
| GRPO w/ Ent Driven AdvBackbone=Qwen3-8B2026.04 | 73.86 | 0.54 | |
| Policy Split + HE promptBackbone=Qwen3-8B2026.04 | 73.04 | 1.02 | |
| GRPO w/ Ent Driven AdvBackbone=Qwen3-4B2026.04 | 69.07 | 0.55 | |
| GRPO w/ Clip-CovBackbone=Qwen3-4B2026.04 | 68.8 | 0.55 | |
| Policy SplitBackbone=Qwen3-4B2026.04 | 68.68 | 0.73 | |
| GRPO w/ Forking Token OnlyBackbone=Qwen3-4B2026.04 | 68.3 | 0.55 | |
| GRPO w/ Ent AdvantageBackbone=Qwen3-4B2026.04 | 68.3 | 0.76 | |
| GRPOBackbone=Qwen3-4B2026.04 | 68.02 | 0.55 | |
| Policy Split + HE promptBackbone=Qwen3-4B2026.04 | 67.68 | 0.84 | |
| GRPO w/ Ent RegularizationBackbone=Qwen3-4B2026.04 | 67.63 | 0.65 | |
| OriginalBackbone=Qwen3-4B2026.04 | 66.79 | 0.55 | |
| GRPO w/ Clip-CovBackbone=Qwen3-1.7B2026.04 | 56.66 | 0.45 | |
| GRPO w/ Ent AdvantageBackbone=Qwen3-1.7B2026.04 | 56.62 | 0.92 | |
| OriginalBackbone=Qwen3-1.7B2026.04 | 56.52 | 0.48 | |
| Policy SplitBackbone=Qwen3-1.7B2026.04 | 56.46 | 0.96 | |
| GRPO w/ Ent RegularizationBackbone=Qwen3-1.7B2026.04 | 56.07 | 0.74 | |
| GRPO w/ Forking Token OnlyBackbone=Qwen3-1.7B2026.04 | 56 | 0.46 | |
| GRPO w/ Ent Driven AdvBackbone=Qwen3-1.7B2026.04 | 55.91 | 0.46 | |
| GRPOBackbone=Qwen3-1.7B2026.04 | 55.71 | 0.46 | |
| Policy Split + HE promptBackbone=Qwen3-1.7B2026.04 | 54.41 | 1.03 |