Mathematical Reasoning on Minerva-Math (avg@1)
47.1Avg@1 AccuracyNPR (Variant)
Evaluation Results
| Method | Links | |
|---|---|---|
| NPR (Variant)Data=orz-8k, Train=Parallel RL, Base=NPR-BETA2025.12 | 47.1 | |
| NPR-BETA (Variant)Data=orz-8k, Train=Parallel SFT, Base=Q3-4B2025.12 | 45.9 | |
| NPRData=orz-8k, Train=Parallel RL, Base=NPR-BETA2025.12 | 43 | |
| SR-BETAData=orz-8k, Train=Sequential SFT, Base=Q3-4B-Inst.2025.12 | 41.5 | |
| Qwen3-4B-Instruct-2507Data=N/A, Train=N/A, Base=N/A2025.12 | 41.2 | |
| NPR-BETAData=orz-8k, Train=Parallel SFT, Base=Q3-4B-Inst.2025.12 | 41.2 | |
| Qwen2.5-32B-InstructData=N/A, Train=N/A, Base=N/A2025.12 | 40.8 | |
| Multiverse-32BData=s1.1-8k, Train=S→P SFT, Base=Q2.5-32B-Inst.2025.12 | 40 | |
| SRData=orz-8k, Train=Sequential RL, Base=NPR-BETA2025.12 | 38.2 | |
| Multiverse-4BData=s1.1-8k, Train=S→P SFT, Base=Q3-4B-Inst.2025.12 | 34.9 | |
| Robust BellmanTraining Domain=Math Domain2025.12 | 31.99 | |
| DVPOTraining Domain=Math Domain2025.12 | 31.62 | |
| PPOTraining Domain=Math Domain2025.12 | 30.51 | |
| BaseTraining Domain=Math Domain2025.12 | 28.68 | |
| GRPOTraining Domain=Math Domain2025.12 | 28.68 | |
| Qwen3-4B (Non-Thinking)Data=N/A, Train=N/A, Base=N/A2025.12 | 28.5 | |
| Dr.GRPOTraining Domain=Math Domain2025.12 | 27.94 | |
| Reinforce++Training Domain=Math Domain2025.12 | 27.21 | |
| LCO-LCHBackbone=Qwen-3-4B2026.03 | 24.26 | |
| LCO-KLDBackbone=Qwen-3-4B2026.03 | 23.95 | |
| GRPOBackbone=Qwen-3-4B2026.03 | 21.75 | |
| LCO-MSEBackbone=Qwen-3-4B2026.03 | 21.37 | |
| PPOBackbone=Qwen-3-4B2026.03 | 20.95 | |
| DAPOBackbone=Qwen-3-4B2026.03 | 19.75 | |
| REINFORCEBackbone=Qwen-3-4B2026.03 | 19.48 | |
| GSPOBackbone=Qwen-3-4B2026.03 | 18.38 | |
| LCO-KLDBackbone=Qwen-2.5-3B2026.03 | 16.71 | |
| ϕDPOBackbone=Qwen-3-4B2026.03 | 16.54 | |
| ϕDPOBackbone=Qwen-2.5-3B2026.03 | 16.17 | |
| LCO-LCHBackbone=Qwen-2.5-3B2026.03 | 15.38 | |
| π*Backbone=Qwen-2.5-3B2026.03 | 15.18 | |
| LCO-MSEBackbone=Qwen-2.5-3B2026.03 | 15.12 | |
| GRPOBackbone=Qwen-2.5-3B2026.03 | 14.89 | |
| GSPOBackbone=Qwen-2.5-3B2026.03 | 14.87 | |
| π*Backbone=Qwen-3-4B2026.03 | 14.39 | |
| PPOBackbone=Qwen-2.5-3B2026.03 | 13.97 | |
| DAPOBackbone=Qwen-2.5-3B2026.03 | 13.23 | |
| SFTBackbone=Qwen-3-4B2026.03 | 12.53 | |
| REINFORCEBackbone=Qwen-2.5-3B2026.03 | 12.35 | |
| SFTBackbone=Qwen-2.5-3B2026.03 | 10.29 |