Mathematical Reasoning on LiveMathBench
74.38AccuracySMCS
Evaluation Results
| Method | Links | |
|---|---|---|
| SMCS2025.07 | 74.38 | |
| Self-MoA2025.07 | 60.33 | |
| GPT-4.12025.07 | 59.5 | |
| QwQ-32B2025.07 | 58.68 | |
| GSPO + TACBackbone=DeepSeek-R1-Distill-Qwen-7B, Training steps=30002025.10 | 24 | |
| DRGRPOBackbone=DeepSeek-R1-Distill-Qwen-7B, Training steps=30002025.10 | 21 | |
| DeepMathBackbone=DeepSeek-R1-Distill-Qwen-7B, Training steps=30002025.10 | 17 | |
| VeriThinkerBackbone=DeepSeek-R1-Distill-Qwen-7B, Training steps=30002025.10 | 14 | |
| GSPO + TACBackbone=DeepSeek-R1-Distill-Qwen-1.5B, Training steps=30002025.10 | 14 | |
| BASELINEBackbone=DeepSeek-R1-Distill-Qwen-7B, Training steps=30002025.10 | 13 | |
| GRPO-LEADBackbone=DeepSeek-R1-Distill-Qwen-7B, Training steps=30002025.10 | 13 | |
| ExGRPOBackbone=DeepSeek-R1-Distill-Qwen-7B, Training steps=30002025.10 | 13 | |
| SkyWorkBackbone=DeepSeek-R1-Distill-Qwen-7B, Training steps=30002025.10 | 12 | |
| BASELINEBackbone=DeepSeek-R1-Distill-Qwen-1.5B, Training steps=30002025.10 | 11 | |
| ExGRPOBackbone=DeepSeek-R1-Distill-Qwen-1.5B, Training steps=30002025.10 | 10 | |
| Open-RS3Backbone=DeepSeek-R1-Distill-Qwen-1.5B, Training steps=30002025.10 | 6 | |
| DRA-GRPOBackbone=DeepSeek-R1-Distill-Qwen-1.5B, Training steps=30002025.10 | 5 | |
| STILL-3Backbone=DeepSeek-R1-Distill-Qwen-1.5B, Training steps=30002025.10 | 3 | |
| Eurus-2Backbone=DeepSeek-R1-Distill-Qwen-7B, Training steps=30002025.10 | 2 |