Mathematical Reasoning on MATH500 (Pass@1, Pass@16, Major@16)
83Pass@1DiRL
Evaluation Results
| Method | Links | |||||
|---|---|---|---|---|---|---|
| DiRLBase Model=Qwen3-4B-Base2026.06 | 83 | 95.9 | 87.7 | — | — | |
| EVOL-RLBase Model=Qwen3-4B-Base2026.06 | 79.5 | 94.8 | 85.3 | — | — | |
| G2RLBase Model=Qwen3-4B-Base2026.06 | 79.3 | 94.7 | 86.5 | — | — | |
| Entropy BonusBase Model=Qwen3-4B-Base2026.06 | 78.3 | 93.7 | 84.8 | — | — | |
| GRPOBase Model=Qwen3-4B-Base2026.06 | 77.4 | 93.1 | 82.2 | — | — | |
| CorR-POBackbone=Qwen2.5-14B2026.05 | 75.6 | 90.6 | 81.2 | — | — | |
| GSPOBackbone=Qwen2.5-14B2026.05 | 75 | 90.4 | 76.8 | — | — | |
| Dr.GRPOBackbone=Qwen2.5-14B2026.05 | 74.8 | 90.2 | 78.6 | — | — | |
| GRPOBackbone=Qwen2.5-14B2026.05 | 73.8 | 90 | 78.2 | — | — | |
| DAPOBackbone=Qwen2.5-14B2026.05 | 71 | 89.8 | 76 | — | — | |
| DAPOBase model=Qwen3-1.7B2026.05 | 70 | 93.2 | 83.8 | — | — | |
| GRPOBase model=Qwen3-1.7B2026.05 | 69 | 92.2 | 83 | — | — | |
| DiRLBase Model=Qwen3-1.7B-Base2026.06 | 68.5 | 92.1 | 79.4 | — | — | |
| G2RLBase Model=Qwen3-1.7B-Base2026.06 | 67 | 91.6 | 78.6 | — | — | |
| CorR-POBase model=Qwen3-1.7B2026.05 | 65.8 | 90 | 84.2 | — | — | |
| Entropy BonusBase Model=Qwen3-1.7B-Base2026.06 | 65.3 | 89.9 | 74.5 | — | — | |
| EVOL-RLBase Model=Qwen3-1.7B-Base2026.06 | 65.3 | 89.3 | 75.2 | — | — | |
| GRPOBase Model=Qwen3-1.7B-Base2026.06 | 64.6 | 89.1 | 73.7 | — | — | |
| GSPOBase model=Qwen3-1.7B2026.05 | 62 | 91 | 80.2 | — | — | |
| BaseBackbone=Qwen2.5-14B2026.05 | 60.4 | 90.8 | 79.8 | — | — | |
| BaseBase model=Qwen3-1.7B2026.05 | 60.4 | 90.8 | 79.8 | — | — | |
| Dr.GRPOBase model=Qwen3-1.7B2026.05 | 58.8 | 92.8 | 83.8 | — | — | |
| ELM inputBackbone=Llama-3.1-8B-Instr., Setting=Online2026.06 | — | — | — | — | 51.4 | |
| ELM inputBackbone=Qwen2.5-Math-7B, Setting=Online2026.06 | — | — | — | — | 72.5 | |
| ELM kvBackbone=Llama-3.1-8B-Instr., Setting=Online2026.06 | — | — | — | — | 50.7 | |
| ELM kvBackbone=Qwen2.5-Math-7B, Setting=Online2026.06 | — | — | — | — | 72.6 | |
| GRPOBackbone=Llama-3.1-8B-Instr., Setting=Offline2026.06 | — | — | — | — | 47 | |
| GRPOBackbone=Qwen2.5-Math-7B, Setting=Offline2026.06 | — | — | — | — | 68 | |
| ICLBackbone=Llama-3.1-8B-Instr., Setting=Online2026.06 | — | — | — | — | 46.3 | |
| LAGBackbone=Llama-3.1-8B-Instr., Setting=Online2026.06 | — | — | — | — | 44 | |
| Reasoning BankBackbone=Llama-3.1-8B-Instr., Setting=Online2026.06 | — | — | — | — | 42.7 | |
| TreeRPOBase Model=Qwen2.5-Math-1.5B2026.05 | — | — | — | 70.7 | — | |
| TTRLBackbone=Llama-3.1-8B-Instr., Setting=Offline2026.06 | — | — | — | — | 45.6 | |
| TTRLBackbone=Qwen2.5-Math-7B, Setting=Offline2026.06 | — | — | — | — | 67.2 | |
| VeriGateBase Model=Qwen2.5-Math-1.5B2026.05 | — | — | — | 70 | — | |
| Zero-shot CoTBackbone=Llama-3.1-8B-Instr.2026.06 | — | — | — | — | 45 | |
| Zero-shot CoTBackbone=Qwen2.5-Math-7B2026.06 | — | — | — | — | 67 |