Mathematical Reasoning on Kaoyan (pass@1)
73.37pass@1 ScoreSGPO
Evaluation Results
| Method | Links | |
|---|---|---|
| SGPOBackbone=QwQ-32B, Judge Model=DeepSeek-V3-03242025.05 | 73.37 | |
| GRPOBackbone=QwQ-32B2025.05 | 71.36 | |
| BaselineBackbone=QwQ-32B2025.05 | 64.32 | |
| SGPOBackbone=DeepSeek-R1-Distill-Qwen-7B, Judge Model=QwQ-32B, Stability Parameters=w/o {beta,gamma}2025.05 | 58.29 | |
| SGPOBackbone=DeepSeek-R1-Distill-Qwen-7B, Judge Model=o4-mini-04162025.05 | 57.79 | |
| SGPOBackbone=DeepSeek-R1-Distill-Qwen-7B, Judge Model=Qwen3-235B-A22B2025.05 | 56.78 | |
| GRPOBackbone=DeepSeek-R1-Distill-Qwen-7B2025.05 | 55.78 | |
| SGPOBackbone=DeepSeek-R1-Distill-Qwen-7B, Judge Model=DeepSeek-V3-03242025.05 | 54.77 | |
| SGPOBackbone=DeepSeek-R1-Distill-Qwen-7B, Judge Model=QwQ-32B2025.05 | 52.26 | |
| BaselineBackbone=DeepSeek-R1-Distill-Qwen-7B2025.05 | 50.25 | |
| GRPOBackbone=Qwen2.5-32B-Instruct2025.05 | 48.24 | |
| SGPOBackbone=Qwen2.5-32B-Instruct, Judge Model=o4-mini-04162025.05 | 48.24 | |
| BaselineBackbone=Qwen2.5-32B-Instruct2025.05 | 45.73 | |
| GRPOBackbone=Qwen2.5-14B-Instruct2025.05 | 43.22 | |
| SGPOBackbone=DeepSeek-R1-Distill-Llama-8B, Judge Model=Claude-3.72025.05 | 39.7 | |
| SGPOBackbone=Qwen2.5-14B-Instruct, Judge Model=o4-mini-04162025.05 | 38.69 | |
| BaselineBackbone=Qwen2.5-14B-Instruct2025.05 | 37.69 | |
| GRPOBackbone=DeepSeek-R1-Distill-Llama-8B2025.05 | 35.68 | |
| BaselineBackbone=DeepSeek-R1-Distill-Llama-8B2025.05 | 29.15 |