Mathematical Reasoning on LMB (LiveMathBench)
35.8AccuracyRePro
Evaluation Results
| Method | Links | |
|---|---|---|
| ReProBackbone=Qwen3-8B, Base Training=GRPO2025.12 | 35.8 | |
| OriginalBackbone=Qwen3-8B2025.12 | 35.3 | |
| GRPOBackbone=Qwen3-8B2025.12 | 35.1 | |
| RF++ B + ReProBackbone=Qwen3-1.7B2025.12 | 22 | |
| PPOBackbone=Qwen3-1.7B2025.12 | 20.5 | |
| PPO + ReProBackbone=Hunyuan-1.8B-Instruct2025.12 | 20.5 | |
| GRPO + ReProBackbone=Qwen3-1.7B2025.12 | 19.5 | |
| PPOBackbone=Hunyuan-1.8B-Instruct2025.12 | 19.5 | |
| OriginalBackbone=Qwen3-1.7B2025.12 | 18.8 | |
| PPO + ReProBackbone=Qwen3-1.7B2025.12 | 18.8 | |
| GRPOBackbone=Qwen3-1.7B2025.12 | 18.8 | |
| RF++ BBackbone=Qwen3-1.7B2025.12 | 18.5 | |
| RF++ B + ReProBackbone=Hunyuan-1.8B-Instruct2025.12 | 17.8 | |
| RF++ BBackbone=Hunyuan-1.8B-Instruct2025.12 | 17.5 | |
| GRPO + ReProBackbone=Hunyuan-1.8B-Instruct2025.12 | 17.5 | |
| GRPOBackbone=Hunyuan-1.8B-Instruct2025.12 | 16 | |
| PPO + ReProBackbone=MobileLLM-R1-950M2025.12 | 15.8 | |
| OriginalBackbone=Hunyuan-1.8B-Instruct2025.12 | 15 | |
| ReProBackbone=Qwen3-4B-Base, Sample Count=Avg@4, Evaluation Domain=In-domain, Base Method=GRPO2025.12 | 14.5 | |
| PPOBackbone=MobileLLM-R1-950M2025.12 | 14.5 | |
| GRPOBackbone=Qwen3-4B-Base, Sample Count=Avg@4, Evaluation Domain=In-domain2025.12 | 12.5 | |
| OriginalBackbone=MobileLLM-R1-950M2025.12 | 10.5 | |
| OriginalBackbone=Qwen3-4B-Base, Sample Count=Avg@4, Evaluation Domain=In-domain2025.12 | 7.5 |