Science Reasoning on GPQA Diam
58.9AccuracyPolicy Split
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| Policy SplitBackbone=Qwen3-8B2026.04 | 58.9 | 0.9 | |
| GRPO w/ Ent RegularizationBackbone=Qwen3-8B2026.04 | 57.87 | 0.72 | |
| GRPO w/ Ent AdvantageBackbone=Qwen3-8B2026.04 | 57.77 | 0.75 | |
| GRPO w/ Forking Token OnlyBackbone=Qwen3-8B2026.04 | 57.07 | 0.57 | |
| OriginalBackbone=Qwen3-8B2026.04 | 56.89 | 0.57 | |
| GRPOBackbone=Qwen3-8B2026.04 | 56.45 | 0.57 | |
| GRPO w/ Clip-CovBackbone=Qwen3-8B2026.04 | 56.44 | 0.57 | |
| GRPO w/ Ent Driven AdvBackbone=Qwen3-8B2026.04 | 55.56 | 0.57 | |
| Policy Split + HE promptBackbone=Qwen3-8B2026.04 | 53.72 | 1.08 | |
| GRPO w/ Ent Driven AdvBackbone=Qwen3-4B2026.04 | 53.6 | 0.61 | |
| GRPO w/ Forking Token OnlyBackbone=Qwen3-4B2026.04 | 53.22 | 0.62 | |
| Policy Split + HE promptBackbone=Qwen3-4B2026.04 | 52.59 | 0.94 | |
| Policy SplitBackbone=Qwen3-4B2026.04 | 52.53 | 0.82 | |
| OriginalBackbone=Qwen3-4B2026.04 | 52.27 | 0.58 | |
| GRPO w/ Ent AdvantageBackbone=Qwen3-4B2026.04 | 51.89 | 0.84 | |
| GRPO w/ Ent RegularizationBackbone=Qwen3-4B2026.04 | 51.86 | 0.76 | |
| GRPO w/ Clip-CovBackbone=Qwen3-4B2026.04 | 51.77 | 0.62 | |
| GRPOBackbone=Qwen3-4B2026.04 | 51.01 | 0.59 | |
| GRPO w/ Ent Driven AdvBackbone=Qwen3-1.7B2026.04 | 39.46 | 0.51 | |
| GRPO w/ Forking Token OnlyBackbone=Qwen3-1.7B2026.04 | 38.95 | 0.51 | |
| GRPO w/ Ent RegularizationBackbone=Qwen3-1.7B2026.04 | 38.28 | 0.88 | |
| OriginalBackbone=Qwen3-1.7B2026.04 | 38.19 | 0.51 | |
| Policy SplitBackbone=Qwen3-1.7B2026.04 | 38.07 | 1.06 | |
| GRPOBackbone=Qwen3-1.7B2026.04 | 37.88 | 0.51 | |
| GRPO w/ Ent AdvantageBackbone=Qwen3-1.7B2026.04 | 37.69 | 1 | |
| GRPO w/ Clip-CovBackbone=Qwen3-1.7B2026.04 | 37.63 | 0.5 | |
| Policy Split + HE promptBackbone=Qwen3-1.7B2026.04 | 35.61 | 1.11 |