Mathematical Reasoning on Verify-RL (D5)
72AccuracyVerify-RL
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| Verify-RLModel=DS-R1-1.5B, RL Algorithm=GRPO2026.02 | 72 | 80 | |
| Verify-RLModel=Qwen3-0.6B, RL Algorithm=GRPO2026.02 | 70 | 94 | |
| Verify-RLModel=Qwen3-3B, RL Algorithm=GRPO2026.02 | 70 | 45 | |
| Verify-RLModel=Qwen3-1.5B, RL Algorithm=GRPO2026.02 | 68 | 112 | |
| PPOModel=Qwen3-3B, RL Algorithm=PPO2026.02 | 66 | — | |
| PPOModel=DS-R1-1.5B, RL Algorithm=PPO2026.02 | 66 | — | |
| DPOModel=Qwen3-3B, RL Algorithm=DPO2026.02 | 65 | — | |
| PPOModel=Qwen3-0.6B, RL Algorithm=PPO2026.02 | 64 | — | |
| DPOModel=DS-R1-1.5B, RL Algorithm=DPO2026.02 | 64 | — | |
| DPOModel=Qwen3-0.6B, RL Algorithm=DPO2026.02 | 62 | — | |
| PPOModel=Qwen3-1.5B, RL Algorithm=PPO2026.02 | 62 | — | |
| DPOModel=Qwen3-1.5B, RL Algorithm=DPO2026.02 | 60 | — | |
| BaseModel=Qwen3-3B, RL Algorithm=Base2026.02 | 48 | — | |
| BaseModel=DS-R1-1.5B, RL Algorithm=Base2026.02 | 40 | — | |
| BaseModel=Qwen3-0.6B, RL Algorithm=Base2026.02 | 36 | — | |
| BaseModel=Qwen3-1.5B, RL Algorithm=Base2026.02 | 32 | — |