Mathematical Reasoning Accuracy on MINERVA
49.3AccuracyGSPO + TAC
Evaluation Results
| Method | Links | |
|---|---|---|
| GSPO + TACBackbone=DeepSeek-R1-Distill-Qwen-7B, Training steps=30002025.10 | 49.3 | |
| GRPO-LEADBackbone=DeepSeek-R1-Distill-Qwen-7B, Training steps=30002025.10 | 47.4 | |
| SkyWorkBackbone=DeepSeek-R1-Distill-Qwen-7B, Training steps=30002025.10 | 43.4 | |
| DeepMathBackbone=DeepSeek-R1-Distill-Qwen-7B, Training steps=30002025.10 | 42.6 | |
| ExGRPOBackbone=DeepSeek-R1-Distill-Qwen-7B, Training steps=30002025.10 | 41 | |
| BASELINEBackbone=DeepSeek-R1-Distill-Qwen-7B, Training steps=30002025.10 | 40.4 | |
| Eurus-2Backbone=DeepSeek-R1-Distill-Qwen-7B, Training steps=30002025.10 | 38.6 | |
| VeriThinkerBackbone=DeepSeek-R1-Distill-Qwen-7B, Training steps=30002025.10 | 34.9 | |
| Qwen2.5-1.5B R1-Distilled (base)context size=10242026.06 | 32 | |
| Open-RScheckpoints=3, context size=10242026.06 | 31.6 | |
| ExGRPOBackbone=DeepSeek-R1-Distill-Qwen-1.5B, Training steps=30002025.10 | 30.9 | |
| RREDCoT-Nanocheckpoints=2, context size=10242026.06 | 30.5 | |
| GSPO + TACBackbone=DeepSeek-R1-Distill-Qwen-1.5B, Training steps=30002025.10 | 27.2 | |
| Open-RS3Backbone=DeepSeek-R1-Distill-Qwen-1.5B, Training steps=30002025.10 | 26.8 | |
| BASELINEBackbone=DeepSeek-R1-Distill-Qwen-1.5B, Training steps=30002025.10 | 26.5 | |
| DRA-GRPOBackbone=DeepSeek-R1-Distill-Qwen-1.5B, Training steps=30002025.10 | 26.1 | |
| STILL-3Backbone=DeepSeek-R1-Distill-Qwen-1.5B, Training steps=30002025.10 | 23.2 | |
| DRGRPOBackbone=DeepSeek-R1-Distill-Qwen-7B, Training steps=30002025.10 | 10.3 |