Mathematical Reasoning on AIME 2024 (Accuracy and Token Count)
76.7AccuracyGRPO
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| GRPOBackbone=Qwen3-8B2026.04 | 76.7 | 12,545 | |
| GRPO-λBackbone=Qwen3-8B2026.04 | 76.7 | 10,554 | |
| Step-GRPOBackbone=Qwen3-8B2026.04 | 76.7 | 11,657 | |
| Step-GRPOBackbone=Qwen3-4B2026.04 | 76.7 | 11,435 | |
| GRPO+LPBackbone=Qwen3-8B2026.04 | 73.3 | 9,899 | |
| GRPOBackbone=Qwen3-4B2026.04 | 73.3 | 12,126 | |
| VanillaBackbone=Qwen3-8B2026.04 | 70 | 15,880 | |
| VanillaBackbone=Qwen3-4B2026.04 | 70 | 15,453 | |
| GRPO-8kBackbone=Qwen3-4B2026.04 | 70 | 10,515 | |
| GRPO+LPBackbone=Qwen3-4B2026.04 | 70 | 10,631 | |
| GRPO+SOPBackbone=Qwen3-4B2026.04 | 70 | 9,363 | |
| GRPO-λBackbone=Qwen3-4B2026.04 | 70 | 9,094 | |
| GRPO-8kBackbone=Qwen3-8B2026.04 | 66.7 | 10,422 | |
| GRPO+SOPBackbone=Qwen3-8B2026.04 | 66.7 | 10,173 | |
| DEER+SFTBackbone=Qwen3-8B2026.04 | 63.3 | 10,623 | |
| DEER+SFTBackbone=Qwen3-4B2026.04 | 53.3 | 12,105 | |
| GRPO+LPBackbone=Qwen3-1.7B2026.04 | 53.3 | 11,508 | |
| GRPOBackbone=Qwen3-1.7B2026.04 | 50 | 15,039 | |
| VanillaBackbone=Qwen3-1.7B2026.04 | 43.3 | 18,552 | |
| GRPO-8kBackbone=Qwen3-1.7B2026.04 | 43.3 | 13,600 | |
| Step-GRPOBackbone=Qwen3-1.7B2026.04 | 43.3 | 13,728 | |
| GRPO+SOPBackbone=Qwen3-1.7B2026.04 | 40 | 13,934 | |
| GRPO-λBackbone=Qwen3-1.7B2026.04 | 40 | 13,572 | |
| DEER+SFTBackbone=Qwen3-1.7B2026.04 | 30 | 12,758 |