Mathematical Reasoning on KSAT 2025
83.3AccuracyGSPO + TAC
Evaluation Results
| Method | Links | |
|---|---|---|
| GSPO + TACBackbone=DeepSeek-R1-Distill-Qwen-7B, Training steps=30002025.10 | 83.3 | |
| GRPO-LEADBackbone=DeepSeek-R1-Distill-Qwen-7B, Training steps=30002025.10 | 76.7 | |
| VeriThinkerBackbone=DeepSeek-R1-Distill-Qwen-7B, Training steps=30002025.10 | 76.7 | |
| BASELINEBackbone=DeepSeek-R1-Distill-Qwen-7B, Training steps=30002025.10 | 66.7 | |
| SkyWorkBackbone=DeepSeek-R1-Distill-Qwen-7B, Training steps=30002025.10 | 66.7 | |
| DRGRPOBackbone=DeepSeek-R1-Distill-Qwen-7B, Training steps=30002025.10 | 66.7 | |
| DeepMathBackbone=DeepSeek-R1-Distill-Qwen-7B, Training steps=30002025.10 | 63.3 | |
| ExGRPOBackbone=DeepSeek-R1-Distill-Qwen-7B, Training steps=30002025.10 | 63.3 | |
| GSPO + TACBackbone=DeepSeek-R1-Distill-Qwen-1.5B, Training steps=30002025.10 | 63.3 | |
| BASELINEBackbone=DeepSeek-R1-Distill-Qwen-1.5B, Training steps=30002025.10 | 60 | |
| STILL-3Backbone=DeepSeek-R1-Distill-Qwen-1.5B, Training steps=30002025.10 | 53.3 | |
| Open-RS3Backbone=DeepSeek-R1-Distill-Qwen-1.5B, Training steps=30002025.10 | 50 | |
| DRA-GRPOBackbone=DeepSeek-R1-Distill-Qwen-1.5B, Training steps=30002025.10 | 43.3 | |
| ExGRPOBackbone=DeepSeek-R1-Distill-Qwen-1.5B, Training steps=30002025.10 | 40 | |
| Eurus-2Backbone=DeepSeek-R1-Distill-Qwen-7B, Training steps=30002025.10 | 20 |