Mathematical Reasoning on Olympiad (Performance %)
50Performance (%)SGPO
Evaluation Results
| Method | Links | |
|---|---|---|
| SGPOBackbone=Qwen2.5-7B-Instruct2026.06 | 50 | |
| HPTBackbone=Qwen2.5-7B-Instruct2026.06 | 48.8 | |
| SFT+GRPOBackbone=Qwen2.5-7B-Instruct2026.06 | 48.4 | |
| LUFFYBackbone=Qwen2.5-7B-Instruct2026.06 | 47.6 | |
| SFTBackbone=Qwen2.5-7B-Instruct2026.06 | 40 | |
| Qwen2.5-7B-InstructBackbone=Qwen2.5-7B-Instruct2026.06 | 38.8 | |
| GTBackbone=Phi4-mini-instruct2026.05 | 38.07 | |
| CAREBackbone=Phi4-mini-instruct2026.05 | 36.9 | |
| OracleBackbone=Phi4-mini-instruct2026.05 | 35.12 | |
| RandomBackbone=Phi4-mini-instruct2026.05 | 33.77 | |
| TTRLBackbone=Phi4-mini-instruct2026.05 | 33.55 | |
| ProbBackbone=Phi4-mini-instruct2026.05 | 33.14 | |
| EntropyBackbone=Phi4-mini-instruct2026.05 | 33.1 | |
| VanillaBackbone=Phi4-mini-instruct2026.05 | 24.11 | |
| SGPOBackbone=Qwen2.5-1.5B-Instruct2026.06 | 23.7 | |
| LUFFYBackbone=Qwen2.5-1.5B-Instruct2026.06 | 23.1 | |
| SGPOBackbone=Llama-3.2-8B-Instruct2026.06 | 22.9 | |
| HPTBackbone=Qwen2.5-1.5B-Instruct2026.06 | 22.6 | |
| LUFFYBackbone=Llama-3.2-8B-Instruct2026.06 | 21.9 | |
| SFT+GRPOBackbone=Qwen2.5-1.5B-Instruct2026.06 | 21.7 | |
| HPTBackbone=Llama-3.2-8B-Instruct2026.06 | 20.1 | |
| SFT+GRPOBackbone=Llama-3.2-8B-Instruct2026.06 | 19.3 | |
| Qwen2.5-1.5B-InstructBackbone=Qwen2.5-1.5B-Instruct2026.06 | 18.4 | |
| SFTBackbone=Llama-3.2-8B-Instruct2026.06 | 16.7 | |
| SFTBackbone=Qwen2.5-1.5B-Instruct2026.06 | 16.1 | |
| Llama-3.2-8B-InstructBackbone=Llama-3.2-8B-Instruct2026.06 | 14.5 |