Mathematical Reasoning on OlympiadBench (Avg@32, Pass@32)
65.4Avg@32E3RL
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| E3RLBackbone=Qwen3-8b, RL Strategy=E3RL2026.06 | 65.4 | 81.6 | |
| E3RLBackbone=Qwen3-4b, RL Strategy=E3RL2026.06 | 63.9 | 81.3 | |
| SAPOBackbone=Qwen3-8b, RL Strategy=SAPO2026.06 | 63.9 | 80.5 | |
| DAPOBackbone=Qwen3-8b, RL Strategy=DAPO2026.06 | 63.7 | 80.5 | |
| GSPOBackbone=Qwen3-8b, RL Strategy=GSPO2026.06 | 63.6 | 79.8 | |
| GRPOBackbone=Qwen3-8b, RL Strategy=GRPO2026.06 | 62.9 | 80.1 | |
| GSPOBackbone=Qwen3-4b, RL Strategy=GSPO2026.06 | 61.8 | 80.7 | |
| SAPOBackbone=Qwen3-4b, RL Strategy=SAPO2026.06 | 61.5 | 79.7 | |
| DAPOBackbone=Qwen3-4b, RL Strategy=DAPO2026.06 | 60.6 | 79.9 | |
| GRPOBackbone=Qwen3-4b, RL Strategy=GRPO2026.06 | 60.1 | 78.7 | |
| VanillaBackbone=Qwen3-4b, RL Strategy=Vanilla2026.06 | 49 | 63.3 | |
| VanillaBackbone=Qwen3-8b, RL Strategy=Vanilla2026.06 | 47.2 | 61.9 |