Mathematical Reasoning on AIME 2025 (pass@3)
31.69Pass@3HDPO
Evaluation Results
| Method | Links | |
|---|---|---|
| HDPOBackbone=Qwen2.5-Math-7B, Number of samples=162026.06 | 31.69 | |
| HDPOBackbone=DS-R1-Llama-8B, Number of samples=162026.06 | 30.75 | |
| Critique-GRPOBackbone=8B, Number of samples=162026.06 | 28.44 | |
| HDPOBackbone=Qwen3-4B, Number of samples=162026.06 | 27.92 | |
| LUFFYBackbone=Qwen-Math-7B, Number of samples=162026.06 | 26.61 | |
| GRPOBackbone=Qwen3-4B, Number of samples=162026.06 | 25.78 | |
| GRPOBackbone=Qwen2.5-Math-7B, Number of samples=162026.06 | 24.55 | |
| GRPOBackbone=DS-R1-Llama-8B, Number of samples=162026.06 | 22.32 | |
| EDGE-GRPOBackbone=Qwen-7B, Number of samples=162026.06 | 19.37 | |
| Base ModelBackbone=Qwen3-4B, Number of samples=162026.06 | 18.73 | |
| OatBackbone=Qwen2.5-Math-7B, Number of samples=162026.06 | 16.64 | |
| SimpleRLBackbone=Qwen-2.5-7B, Number of samples=162026.06 | 16.34 | |
| Base ModelBackbone=DS-R1-Llama-8B, Number of samples=162026.06 | 16.08 | |
| Base ModelBackbone=Qwen2.5-Math-7B, Number of samples=162026.06 | 15.04 |