Mathematical Reasoning on CHMath24 (avg@16)
89.39Average Score @16Baseline
Evaluation Results
| Method | Links | |
|---|---|---|
| BaselineBackbone=QwQ-32B2025.05 | 89.39 | |
| GRPOBackbone=QwQ-32B2025.05 | 88.75 | |
| SGPOBackbone=QwQ-32B, Judge Model=DeepSeek-V3-03242025.05 | 88.33 | |
| SGPOBackbone=DeepSeek-R1-Distill-Qwen-7B, Judge Model=DeepSeek-V3-03242025.05 | 77.29 | |
| SGPOBackbone=DeepSeek-R1-Distill-Qwen-7B, Judge Model=o4-mini-04162025.05 | 75 | |
| SGPOBackbone=DeepSeek-R1-Distill-Qwen-7B, Judge Model=QwQ-32B2025.05 | 75 | |
| SGPOBackbone=DeepSeek-R1-Distill-Qwen-7B, Judge Model=QwQ-32B, Stability Parameters=w/o {beta,gamma}2025.05 | 74.58 | |
| BaselineBackbone=DeepSeek-R1-Distill-Qwen-7B2025.05 | 73.75 | |
| SGPOBackbone=DeepSeek-R1-Distill-Qwen-7B, Judge Model=Qwen3-235B-A22B2025.05 | 73.33 | |
| GRPOBackbone=DeepSeek-R1-Distill-Qwen-7B2025.05 | 71.04 | |
| BaselineBackbone=DeepSeek-R1-Distill-Llama-8B2025.05 | 61.46 | |
| SGPOBackbone=DeepSeek-R1-Distill-Llama-8B, Judge Model=Claude-3.72025.05 | 58.96 | |
| GRPOBackbone=DeepSeek-R1-Distill-Llama-8B2025.05 | 57.08 | |
| SGPOBackbone=Qwen2.5-32B-Instruct, Judge Model=o4-mini-04162025.05 | 29.79 | |
| BaselineBackbone=Qwen2.5-32B-Instruct2025.05 | 26.87 | |
| SGPOBackbone=Qwen2.5-14B-Instruct, Judge Model=o4-mini-04162025.05 | 22.92 | |
| GRPOBackbone=Qwen2.5-32B-Instruct2025.05 | 22.5 | |
| BaselineBackbone=Qwen2.5-14B-Instruct2025.05 | 21.88 | |
| GRPOBackbone=Qwen2.5-14B-Instruct2025.05 | 21.88 |