Mathematical Reasoning on AIME 2026 (Avg@32, Pass@32)
51.3Avg@32E3RL
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| E3RLBackbone=Qwen3-8b, RL Strategy=E3RL2026.06 | 51.3 | 73.3 | |
| DAPOBackbone=Qwen3-8b, RL Strategy=DAPO2026.06 | 50.8 | 76.7 | |
| E3RLBackbone=Qwen3-4b, RL Strategy=E3RL2026.06 | 48.5 | 73.3 | |
| GSPOBackbone=Qwen3-8b, RL Strategy=GSPO2026.06 | 48.2 | 73.3 | |
| SAPOBackbone=Qwen3-8b, RL Strategy=SAPO2026.06 | 46.6 | 76.7 | |
| GRPOBackbone=Qwen3-8b, RL Strategy=GRPO2026.06 | 45.8 | 73.3 | |
| SAPOBackbone=Qwen3-4b, RL Strategy=SAPO2026.06 | 44.5 | 66.7 | |
| GRPOBackbone=Qwen3-4b, RL Strategy=GRPO2026.06 | 43.3 | 66.7 | |
| DAPOBackbone=Qwen3-4b, RL Strategy=DAPO2026.06 | 41.9 | 73.3 | |
| GSPOBackbone=Qwen3-4b, RL Strategy=GSPO2026.06 | 41.7 | 66.7 | |
| VanillaBackbone=Qwen3-4b, RL Strategy=Vanilla2026.06 | 25.4 | 53.3 | |
| VanillaBackbone=Qwen3-8b, RL Strategy=Vanilla2026.06 | 25.3 | 53.3 |