Mathematical Reasoning on MATH500 (% Avg@4)
94.1Avg@4 (%)GRPO + RePro
Evaluation Results
| Method | Links | |
|---|---|---|
| GRPO + ReProBackbone=Qwen3-1.7B2025.12 | 94.1 | |
| GRPOBackbone=Qwen3-1.7B2025.12 | 93.4 | |
| RF++ B + ReProBackbone=Qwen3-1.7B2025.12 | 92.7 | |
| PPO + ReProBackbone=Qwen3-1.7B2025.12 | 92.4 | |
| PPOBackbone=Qwen3-1.7B2025.12 | 92.1 | |
| OriginalBackbone=Qwen3-1.7B2025.12 | 91.5 | |
| RF++ BBackbone=Qwen3-1.7B2025.12 | 91.5 | |
| RF++ B + ReProBackbone=Hunyuan-1.8B-Instruct2025.12 | 86.2 | |
| PPOBackbone=Hunyuan-1.8B-Instruct2025.12 | 86 | |
| GRPOBackbone=Hunyuan-1.8B-Instruct2025.12 | 85.6 | |
| RF++ BBackbone=Hunyuan-1.8B-Instruct2025.12 | 85.5 | |
| PPO + ReProBackbone=Hunyuan-1.8B-Instruct2025.12 | 84.3 | |
| GRPO + ReProBackbone=Hunyuan-1.8B-Instruct2025.12 | 84.2 | |
| PPO + ReProBackbone=MobileLLM-R1-950M2025.12 | 83.5 | |
| PPOBackbone=MobileLLM-R1-950M2025.12 | 81.4 | |
| OriginalBackbone=Hunyuan-1.8B-Instruct2025.12 | 81.3 | |
| OriginalBackbone=MobileLLM-R1-950M2025.12 | 76.4 |