Mathematical Reasoning on MATH500 (BCE, MSE, Q-value rankings)
18.48BCEL2R
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| L2RSampling Policy=MetaMath-Mistral-7B, Backbone=Rho-Math-1B, Evaluation Protocol=Best-of-N (BON@8 to BON@128)2025.08 | 18.48 | 22.32 | 23.36 | |
| L2RSampling Policy=Muggle-Math-13B, Backbone=Rho-Math-1B, Evaluation Protocol=Best-of-N (BON@8 to BON@128)2025.08 | 18.88 | 16.04 | 18.56 | |
| BiPRMSampling Policy=Muggle-Math-13B, Backbone=Rho-Math-1B, Evaluation Protocol=Best-of-N (BON@8 to BON@128)2025.08 | 21 | 19.52 | 20.56 | |
| BiPRMSampling Policy=MetaMath-Mistral-7B, Backbone=Rho-Math-1B, Evaluation Protocol=Best-of-N (BON@8 to BON@128)2025.08 | 23.56 | 24.96 | 26.04 | |
| L2RSampling Policy=Muggle-Math-13B, Backbone=Deepseek-Math-7B, Evaluation Protocol=Best-of-N (BON@8 to BON@128)2025.08 | 25.08 | 31.44 | 28.52 | |
| L2RSampling Policy=Muggle-Math-13B, Backbone=Qwen2.5-Math-1.5B, Evaluation Protocol=Best-of-N (BON@8 to BON@128)2025.08 | 25.88 | 31.76 | 30.96 | |
| L2RSampling Policy=MetaMath-Mistral-7B, Backbone=Deepseek-Math-7B, Evaluation Protocol=Best-of-N (BON@8 to BON@128)2025.08 | 31.64 | 34.2 | 32.24 | |
| BiPRMSampling Policy=Muggle-Math-13B, Backbone=Deepseek-Math-7B, Evaluation Protocol=Best-of-N (BON@8 to BON@128)2025.08 | 32.64 | 33.92 | 30.44 | |
| L2RSampling Policy=Llama-3-70B-Instruct, Backbone=Rho-Math-1B, Evaluation Protocol=Best-of-N (BON@8 to BON@128)2025.08 | 32.76 | 34.4 | 34.8 | |
| L2RSampling Policy=MetaMath-Mistral-7B, Backbone=Qwen2.5-Math-1.5B, Evaluation Protocol=Best-of-N (BON@8 to BON@128)2025.08 | 32.8 | 35.68 | 36.2 | |
| BiPRMSampling Policy=Muggle-Math-13B, Backbone=Qwen2.5-Math-1.5B, Evaluation Protocol=Best-of-N (BON@8 to BON@128)2025.08 | 33.92 | 34.96 | 36.08 | |
| BiPRMSampling Policy=MetaMath-Mistral-7B, Backbone=Deepseek-Math-7B, Evaluation Protocol=Best-of-N (BON@8 to BON@128)2025.08 | 36.44 | 37.4 | 34.48 | |
| BiPRMSampling Policy=Llama-3-70B-Instruct, Backbone=Rho-Math-1B, Evaluation Protocol=Best-of-N (BON@8 to BON@128)2025.08 | 37.32 | 38.24 | 39.08 | |
| BiPRMSampling Policy=MetaMath-Mistral-7B, Backbone=Qwen2.5-Math-1.5B, Evaluation Protocol=Best-of-N (BON@8 to BON@128)2025.08 | 38.56 | 39.8 | 40.24 | |
| L2RSampling Policy=Llama-3-70B-Instruct, Backbone=Deepseek-Math-7B, Evaluation Protocol=Best-of-N (BON@8 to BON@128)2025.08 | 40.24 | 42.52 | 40.56 | |
| L2RSampling Policy=Llama-3-70B-Instruct, Backbone=Qwen2.5-Math-1.5B, Evaluation Protocol=Best-of-N (BON@8 to BON@128)2025.08 | 41.44 | 41.76 | 44.2 | |
| BiPRMSampling Policy=Llama-3-70B-Instruct, Backbone=Deepseek-Math-7B, Evaluation Protocol=Best-of-N (BON@8 to BON@128)2025.08 | 43.48 | 48.12 | 43.92 | |
| BiPRMSampling Policy=Llama-3-70B-Instruct, Backbone=Qwen2.5-Math-1.5B, Evaluation Protocol=Best-of-N (BON@8 to BON@128)2025.08 | 48.48 | 46.68 | 47.8 |