Mathematical Reasoning on Math500 (average@16 accuracy)
83.1Average Accuracy @16PROF-BOTH
Evaluation Results
| Method | Links | |
|---|---|---|
| PROF-BOTHModel=Qwen2.5-Math-7B-base, Temperature=1.0, Evaluation Protocol=average@162025.09 | 83.1 | |
| BlendModel=Qwen2.5-Math-7B-base, Temperature=1.0, Evaluation Protocol=average@162025.09 | 81.7 | |
| GRPOModel=Qwen2.5-Math-7B-base, Temperature=1.0, Evaluation Protocol=average@162025.09 | 81.6 | |
| PROF-POSModel=Qwen2.5-Math-7B-base, Temperature=1.0, Evaluation Protocol=average@162025.09 | 81.4 | |
| PROF-BOTHModel=Qwen2.5-Math-1.5B-base, Temperature=1.0, Evaluation Protocol=average@162025.09 | 73.2 | |
| PROF-POSModel=Qwen2.5-Math-1.5B-base, Temperature=1.0, Evaluation Protocol=average@162025.09 | 72.6 | |
| GRPOModel=Qwen2.5-Math-1.5B-base, Temperature=1.0, Evaluation Protocol=average@162025.09 | 70.3 | |
| BlendModel=Qwen2.5-Math-1.5B-base, Temperature=1.0, Evaluation Protocol=average@162025.09 | 67.6 | |
| PROF-POSModel=LLaMA-3.2-3B-instruct, Temperature=1.0, Evaluation Protocol=average@162025.09 | 52.4 | |
| GRPOModel=LLaMA-3.2-3B-instruct, Temperature=1.0, Evaluation Protocol=average@162025.09 | 50.5 | |
| PROF-BOTHModel=LLaMA-3.2-3B-instruct, Temperature=1.0, Evaluation Protocol=average@162025.09 | 49 | |
| BaseModel=Qwen2.5-Math-7B-base, Temperature=1.0, Evaluation Protocol=average@162025.09 | 42 | |
| BaseModel=Qwen2.5-Math-1.5B-base, Temperature=1.0, Evaluation Protocol=average@162025.09 | 39.9 | |
| BlendModel=LLaMA-3.2-3B-instruct, Temperature=1.0, Evaluation Protocol=average@162025.09 | 37.2 | |
| BaseModel=LLaMA-3.2-3B-instruct, Temperature=1.0, Evaluation Protocol=average@162025.09 | 30 |