Mathematical Reasoning on AIME 2024 (P@1 and P@32)
33.5P@1GRPO w/ OAR-G
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| GRPO w/ OAR-GBackbone=Qwen2.5-Math-7B2026.01 | 33.5 | 51.7 | |
| GRPO w/ OAR-PBackbone=Qwen2.5-Math-7B2026.01 | 33.5 | 51.9 | |
| GRPO w/ KTAEBackbone=Qwen2.5-Math-7B2026.01 | 33.3 | 50.8 | |
| GRPO w/ Entropy AdvBackbone=Qwen2.5-Math-7B2026.01 | 32.4 | 49 | |
| GRPOBackbone=Qwen2.5-Math-7B2026.01 | 31.2 | 48.9 | |
| GRPO w/ Random AdvBackbone=Qwen2.5-Math-7B2026.01 | 30.8 | 47.2 | |
| GRPO w/ OAR-PBackbone=Qwen2.5-7B2026.01 | 15.2 | 48.2 | |
| GRPO w/ OAR-GBackbone=Qwen2.5-7B2026.01 | 14.8 | 47.8 | |
| GRPO w/ Entropy AdvBackbone=Qwen2.5-7B2026.01 | 14.4 | 45.7 | |
| GRPOBackbone=Qwen2.5-7B2026.01 | 13.5 | 45 | |
| GRPO w/ Random AdvBackbone=Qwen2.5-7B2026.01 | 13.2 | 44.3 | |
| Qwen2.5-Math-7BBackbone=Qwen2.5-Math-7B2026.01 | 11.8 | 49.4 | |
| Qwen2.5-7BBackbone=Qwen2.5-7B2026.01 | 4.5 | 43.6 |