Math Reasoning on OlympiadBench (Pass@16)
65.78Pass@16GEB-1/π
Evaluation Results
| Method | Links | |
|---|---|---|
| GEB-1/πBackbone=Qwen2.5-7B2025.09 | 65.78 | |
| GEB-πBackbone=Qwen2.5-7B2025.09 | 64.59 | |
| GEB-arctanhπBackbone=Qwen2.5-7B2025.09 | 64.59 | |
| DPOBackbone=Qwen2.5-7B2025.09 | 57.78 | |
| HiLLBackbone=Qwen2.5-7B-Instruct2026.04 | 48.1 | |
| SAGEBackbone=Qwen2.5-7B-Instruct2026.04 | 45.9 | |
| HiLLw/o TWBackbone=Qwen2.5-7B-Instruct2026.04 | 45.7 | |
| GRPOBackbone=Qwen2.5-7B-Instruct2026.04 | 44.5 | |
| LUFFYBackbone=Qwen2.5-7B-Instruct2026.04 | 44.2 | |
| Scaf-GRPOBackbone=Qwen2.5-7B-Instruct2026.04 | 42 | |
| BaseBackbone=Qwen2.5-7B-Instruct2026.04 | 39.2 | |
| HiLLBackbone=Llama-3.2-3B-Instruct2026.04 | 23.2 | |
| HiLLw/o TWBackbone=Llama-3.2-3B-Instruct2026.04 | 22.4 | |
| SAGEBackbone=Llama-3.2-3B-Instruct2026.04 | 22 | |
| GRPOBackbone=Llama-3.2-3B-Instruct2026.04 | 21.8 | |
| Scaf-GRPOBackbone=Llama-3.2-3B-Instruct2026.04 | 19.5 | |
| BaseBackbone=Llama-3.2-3B-Instruct2026.04 | 14.2 | |
| LUFFYBackbone=Llama-3.2-3B-Instruct2026.04 | 11.9 |