Mathematical Reasoning on OlympiadBench (Avg@4, Pass@4)
45.5Avg@4 ScoreForking
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| ForkingBackbone=Qwen2.5-Math-7B, Method Category=Policy Entropy Method2026.04 | 45.5 | 54.4 | |
| EAPOBackbone=Qwen2.5-Math-7B, Method Category=Policy Entropy Method2026.04 | 45.1 | 53.8 | |
| EntroAdvBackbone=Qwen2.5-Math-7B, Method Category=Policy Entropy Method2026.04 | 44.5 | 53.6 | |
| KL-CovBackbone=Qwen2.5-Math-7B, Method Category=Policy Entropy Method2026.04 | 44.2 | 51.8 | |
| DAPOBackbone=Qwen2.5-Math-7B, Method Category=Classic RLVR Method2026.04 | 43.9 | 52.8 | |
| GRPOBackbone=Qwen2.5-Math-7B, Method Category=Classic RLVR Method2026.04 | 42.8 | 51.1 | |
| EntroRegBackbone=Qwen2.5-Math-7B, Method Category=Policy Entropy Method2026.04 | 42.8 | 51.4 | |
| W-REINFBackbone=Qwen2.5-Math-7B, Method Category=Classic RLVR Method2026.04 | 38.9 | 49.3 | |
| PRIMEBackbone=Qwen2.5-Math-7B, Method Category=Classic RLVR Method2026.04 | 20.8 | 34.7 | |
| Base-7BBackbone=Qwen2.5-Math-7B, Method Category=Classic RLVR Method2026.04 | 15.5 | 27.1 |