Science Reasoning on GPQA Diamond (Avg@4)
44.8Avg@4 AccuracyGRPO + RePro
Evaluation Results
| Method | Links | |
|---|---|---|
| GRPO + ReProBackbone=Hunyuan-1.8B-Instruct2025.12 | 44.8 | |
| GRPOBackbone=Hunyuan-1.8B-Instruct2025.12 | 43.6 | |
| RF++ B + ReProBackbone=Hunyuan-1.8B-Instruct2025.12 | 43.1 | |
| PPO + ReProBackbone=Hunyuan-1.8B-Instruct2025.12 | 42.7 | |
| RF++ BBackbone=Hunyuan-1.8B-Instruct2025.12 | 42.4 | |
| PPOBackbone=Hunyuan-1.8B-Instruct2025.12 | 42.1 | |
| PPO + ReProBackbone=Qwen3-1.7B2025.12 | 40.3 | |
| PPOBackbone=Qwen3-1.7B2025.12 | 40.2 | |
| RF++ B + ReProBackbone=Qwen3-1.7B2025.12 | 39.8 | |
| OriginalBackbone=Qwen3-1.7B2025.12 | 39.5 | |
| GRPO + ReProBackbone=Qwen3-1.7B2025.12 | 39.1 | |
| RF++ BBackbone=Qwen3-1.7B2025.12 | 38.5 | |
| GRPOBackbone=Qwen3-1.7B2025.12 | 38.3 | |
| OriginalBackbone=Hunyuan-1.8B-Instruct2025.12 | 38 | |
| PPO + ReProBackbone=MobileLLM-R1-950M2025.12 | 24.1 | |
| PPOBackbone=MobileLLM-R1-950M2025.12 | 22.6 | |
| OriginalBackbone=MobileLLM-R1-950M2025.12 | 19.2 |