Mathematical Reasoning on AMC 2023 (average@16 accuracy)
70.9Average@16 AccuracyPROF-BOTH
Evaluation Results
| Method | Links | |
|---|---|---|
| PROF-BOTHModel=Qwen2.5-Math-7B-base, Temperature=1.0, Evaluation Protocol=average@162025.09 | 70.9 | |
| GRPOModel=Qwen2.5-Math-7B-base, Temperature=1.0, Evaluation Protocol=average@162025.09 | 64.4 | |
| PROF-POSModel=Qwen2.5-Math-7B-base, Temperature=1.0, Evaluation Protocol=average@162025.09 | 64.2 | |
| BlendModel=Qwen2.5-Math-7B-base, Temperature=1.0, Evaluation Protocol=average@162025.09 | 58 | |
| PROF-POSModel=Qwen2.5-Math-1.5B-base, Temperature=1.0, Evaluation Protocol=average@162025.09 | 50.3 | |
| PROF-BOTHModel=Qwen2.5-Math-1.5B-base, Temperature=1.0, Evaluation Protocol=average@162025.09 | 49.1 | |
| GRPOModel=Qwen2.5-Math-1.5B-base, Temperature=1.0, Evaluation Protocol=average@162025.09 | 44.5 | |
| BlendModel=Qwen2.5-Math-1.5B-base, Temperature=1.0, Evaluation Protocol=average@162025.09 | 42.5 | |
| BaseModel=Qwen2.5-Math-7B-base, Temperature=1.0, Evaluation Protocol=average@162025.09 | 30 | |
| PROF-POSModel=LLaMA-3.2-3B-instruct, Temperature=1.0, Evaluation Protocol=average@162025.09 | 28.6 | |
| GRPOModel=LLaMA-3.2-3B-instruct, Temperature=1.0, Evaluation Protocol=average@162025.09 | 25.6 | |
| PROF-BOTHModel=LLaMA-3.2-3B-instruct, Temperature=1.0, Evaluation Protocol=average@162025.09 | 23.9 | |
| BaseModel=Qwen2.5-Math-1.5B-base, Temperature=1.0, Evaluation Protocol=average@162025.09 | 23.6 | |
| BlendModel=LLaMA-3.2-3B-instruct, Temperature=1.0, Evaluation Protocol=average@162025.09 | 17.2 | |
| BaseModel=LLaMA-3.2-3B-instruct, Temperature=1.0, Evaluation Protocol=average@162025.09 | 10.6 |