Scientific Reasoning on SciBench (pass@3)
44.36pass@3HDPO
Evaluation Results
| Method | Links | |
|---|---|---|
| HDPOBackbone=Qwen2.5-Math-7B, Number of samples=162026.06 | 44.36 | |
| HDPOBackbone=Qwen3-4B, Number of samples=162026.06 | 43.16 | |
| Critique-GRPOBackbone=8B, Number of samples=162026.06 | 41.38 | |
| HDPOBackbone=DS-R1-Llama-8B, Number of samples=162026.06 | 41.02 | |
| GRPOBackbone=DS-R1-Llama-8B, Number of samples=162026.06 | 36.1 | |
| GRPOBackbone=Qwen2.5-Math-7B, Number of samples=162026.06 | 35.54 | |
| GRPOBackbone=Qwen3-4B, Number of samples=162026.06 | 33.92 | |
| LUFFYBackbone=Qwen-Math-7B, Number of samples=162026.06 | 33.37 | |
| OatBackbone=Qwen2.5-Math-7B, Number of samples=162026.06 | 26.31 | |
| EDGE-GRPOBackbone=Qwen-7B, Number of samples=162026.06 | 25.79 | |
| SimpleRLBackbone=Qwen-2.5-7B, Number of samples=162026.06 | 25.72 | |
| Base ModelBackbone=Qwen3-4B, Number of samples=162026.06 | 21.93 | |
| Base ModelBackbone=DS-R1-Llama-8B, Number of samples=162026.06 | 19.03 | |
| Base ModelBackbone=Qwen2.5-Math-7B, Number of samples=162026.06 | 17.7 |