Mathematical Reasoning on Olympiads
70.22Pass@1SGPO
Evaluation Results
| Method | Links | |
|---|---|---|
| SGPOBackbone=QwQ-32B, Judge Model=DeepSeek-V3-03242025.05 | 70.22 | |
| GRPOBackbone=QwQ-32B2025.05 | 69.48 | |
| BaselineBackbone=QwQ-32B2025.05 | 68.74 | |
| GRPOBackbone=DeepSeek-R1-Distill-Qwen-7B2025.05 | 56 | |
| SGPOBackbone=DeepSeek-R1-Distill-Qwen-7B, Judge Model=DeepSeek-V3-03242025.05 | 55.11 | |
| SGPOBackbone=DeepSeek-R1-Distill-Qwen-7B, Judge Model=QwQ-32B, Stability Parameters=w/o {beta,gamma}2025.05 | 55.11 | |
| SGPOBackbone=DeepSeek-R1-Distill-Qwen-7B, Judge Model=o4-mini-04162025.05 | 54.67 | |
| SGPOBackbone=DeepSeek-R1-Distill-Qwen-7B, Judge Model=Qwen3-235B-A22B2025.05 | 54.67 | |
| SGPOBackbone=DeepSeek-R1-Distill-Qwen-7B, Judge Model=QwQ-32B2025.05 | 53.78 | |
| BaselineBackbone=DeepSeek-R1-Distill-Qwen-7B2025.05 | 49.93 | |
| SGPOBackbone=DeepSeek-R1-Distill-Llama-8B, Judge Model=Claude-3.72025.05 | 48.44 | |
| SGPOBackbone=Qwen2.5-32B-Instruct, Judge Model=o4-mini-04162025.05 | 46.81 | |
| GRPOBackbone=DeepSeek-R1-Distill-Llama-8B2025.05 | 46.32 | |
| BaselineBackbone=Qwen2.5-32B-Instruct2025.05 | 45.93 | |
| GRPOBackbone=Qwen2.5-32B-Instruct2025.05 | 45.93 | |
| SGPOBackbone=Qwen2.5-14B-Instruct, Judge Model=o4-mini-04162025.05 | 44 | |
| GRPOBackbone=Qwen2.5-14B-Instruct2025.05 | 43.11 | |
| BaselineBackbone=Qwen2.5-14B-Instruct2025.05 | 41.78 | |
| BaselineBackbone=DeepSeek-R1-Distill-Llama-8B2025.05 | 41.48 |