Mathematical Reasoning on MATH 500 (Acc, Ent)
94.77AccuracyGRPO w/ Ent Advantage
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| GRPO w/ Ent AdvantageBackbone=Qwen3-8B2026.04 | 94.77 | 0.46 | |
| GRPO w/ Clip-CovBackbone=Qwen3-8B2026.04 | 94.45 | 0.3 | |
| GRPOBackbone=Qwen3-8B2026.04 | 94.42 | 0.3 | |
| Policy SplitBackbone=Qwen3-8B2026.04 | 94.4 | 0.48 | |
| OriginalBackbone=Qwen3-8B2026.04 | 94.2 | 0.32 | |
| GRPO w/ Ent Driven AdvBackbone=Qwen3-8B2026.04 | 94.2 | 0.3 | |
| Policy SplitBackbone=Qwen3-4B2026.04 | 94.12 | 0.41 | |
| GRPO w/ Forking Token OnlyBackbone=Qwen3-4B2026.04 | 94.08 | 0.34 | |
| GRPO w/ Ent AdvantageBackbone=Qwen3-4B2026.04 | 94.08 | 0.52 | |
| GRPO w/ Ent RegularizationBackbone=Qwen3-4B2026.04 | 94 | 0.48 | |
| GRPO w/ Forking Token OnlyBackbone=Qwen3-8B2026.04 | 94 | 0.3 | |
| GRPO w/ Ent RegularizationBackbone=Qwen3-8B2026.04 | 94 | 0.43 | |
| GRPO w/ Ent Driven AdvBackbone=Qwen3-4B2026.04 | 93.97 | 0.34 | |
| GRPO w/ Clip-CovBackbone=Qwen3-4B2026.04 | 93.92 | 0.34 | |
| GRPOBackbone=Qwen3-4B2026.04 | 93.9 | 0.34 | |
| OriginalBackbone=Qwen3-4B2026.04 | 93.85 | 0.34 | |
| Policy Split + HE promptBackbone=Qwen3-4B2026.04 | 93.5 | 0.64 | |
| Policy Split + HE promptBackbone=Qwen3-8B2026.04 | 93.33 | 0.67 | |
| GRPO w/ Ent AdvantageBackbone=Qwen3-1.7B2026.04 | 89.62 | 0.69 | |
| GRPO w/ Ent RegularizationBackbone=Qwen3-1.7B2026.04 | 89.6 | 0.59 | |
| Policy SplitBackbone=Qwen3-1.7B2026.04 | 89.33 | 0.59 | |
| GRPO w/ Forking Token OnlyBackbone=Qwen3-1.7B2026.04 | 89.15 | 0.31 | |
| GRPOBackbone=Qwen3-1.7B2026.04 | 89.12 | 0.31 | |
| GRPO w/ Ent Driven AdvBackbone=Qwen3-1.7B2026.04 | 89.1 | 0.32 | |
| OriginalBackbone=Qwen3-1.7B2026.04 | 89.08 | 0.34 | |
| GRPO w/ Clip-CovBackbone=Qwen3-1.7B2026.04 | 89.03 | 0.31 | |
| Policy Split + HE promptBackbone=Qwen3-1.7B2026.04 | 87.38 | 0.65 |