Mathematical Reasoning on GradeMath (pass@1)
64.76Pass@1SGPO
Evaluation Results
| Method | Links | |
|---|---|---|
| SGPOBackbone=QwQ-32B, Judge Model=DeepSeek-V3-03242025.05 | 64.76 | |
| GRPOBackbone=QwQ-32B2025.05 | 63.81 | |
| BaselineBackbone=QwQ-32B2025.05 | 62.38 | |
| BaselineBackbone=Qwen2.5-32B-Instruct2025.05 | 53.81 | |
| SGPOBackbone=Qwen2.5-32B-Instruct, Judge Model=o4-mini-04162025.05 | 53.81 | |
| SGPOBackbone=Qwen2.5-14B-Instruct, Judge Model=o4-mini-04162025.05 | 53.33 | |
| GRPOBackbone=Qwen2.5-32B-Instruct2025.05 | 52.86 | |
| BaselineBackbone=Qwen2.5-14B-Instruct2025.05 | 49.52 | |
| SGPOBackbone=DeepSeek-R1-Distill-Qwen-7B, Judge Model=DeepSeek-V3-03242025.05 | 47.17 | |
| GRPOBackbone=Qwen2.5-14B-Instruct2025.05 | 47.14 | |
| SGPOBackbone=DeepSeek-R1-Distill-Qwen-7B, Judge Model=Qwen3-235B-A22B2025.05 | 46.67 | |
| SGPOBackbone=DeepSeek-R1-Distill-Qwen-7B, Judge Model=o4-mini-04162025.05 | 46.19 | |
| SGPOBackbone=DeepSeek-R1-Distill-Qwen-7B, Judge Model=QwQ-32B2025.05 | 45.24 | |
| GRPOBackbone=DeepSeek-R1-Distill-Qwen-7B2025.05 | 43.33 | |
| SGPOBackbone=DeepSeek-R1-Distill-Qwen-7B, Judge Model=QwQ-32B, Stability Parameters=w/o {beta,gamma}2025.05 | 42.38 | |
| BaselineBackbone=DeepSeek-R1-Distill-Qwen-7B2025.05 | 41.43 | |
| SGPOBackbone=DeepSeek-R1-Distill-Llama-8B, Judge Model=Claude-3.72025.05 | 29.05 | |
| GRPOBackbone=DeepSeek-R1-Distill-Llama-8B2025.05 | 28.33 | |
| BaselineBackbone=DeepSeek-R1-Distill-Llama-8B2025.05 | 23.81 |