General Reasoning on MMLU-Pro (pass@3)
76.12Pass@3HDPO
Evaluation Results
| Method | Links | |
|---|---|---|
| HDPOBackbone=Qwen3-4B, Number of samples=162026.06 | 76.12 | |
| Critique-GRPOBackbone=8B, Number of samples=162026.06 | 74.31 | |
| GRPOBackbone=Qwen3-4B, Number of samples=162026.06 | 68.57 | |
| HDPOBackbone=DS-R1-Llama-8B, Number of samples=162026.06 | 67.9 | |
| LUFFYBackbone=Qwen-Math-7B, Number of samples=162026.06 | 67.63 | |
| HDPOBackbone=Qwen2.5-Math-7B, Number of samples=162026.06 | 65.63 | |
| GRPOBackbone=DS-R1-Llama-8B, Number of samples=162026.06 | 59.53 | |
| Base ModelBackbone=Qwen3-4B, Number of samples=162026.06 | 57.95 | |
| EDGE-GRPOBackbone=Qwen-7B, Number of samples=162026.06 | 54.1 | |
| GRPOBackbone=Qwen2.5-Math-7B, Number of samples=162026.06 | 53.19 | |
| Base ModelBackbone=DS-R1-Llama-8B, Number of samples=162026.06 | 48.57 | |
| OatBackbone=Qwen2.5-Math-7B, Number of samples=162026.06 | 47.72 | |
| SimpleRLBackbone=Qwen-2.5-7B, Number of samples=162026.06 | 46.48 | |
| Base ModelBackbone=Qwen2.5-Math-7B, Number of samples=162026.06 | 36.74 |