Mathematical Reasoning on Minerva (P@1, ASRt, RAS)
30.59P@1BaseRL
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| BaseRLBackbone Model=Qwen2.5-Math-7B2025.09 | 30.59 | — | — | |
| DecepChainBackbone Model=Qwen2.5-Math-7B2025.09 | 28.52 | 97.57 | 91.49 | |
| BaseRLBackbone Model=DeepSeek-R1-Distill-Qwen-1.5B2025.09 | 27.65 | — | — | |
| DTCoTBackbone Model=Qwen2.5-Math-7B2025.09 | 27.35 | 72.79 | 0.54 | |
| BadChainBackbone Model=Qwen2.5-Math-7B2025.09 | 26.91 | 73.9 | 3.01 | |
| BadNetBackbone Model=Qwen2.5-Math-7B2025.09 | 26.54 | 74.19 | 2.77 | |
| BaseRLBackbone Model=Qwen2.5-Math-1.5B2025.09 | 25.96 | — | — | |
| DecepChainBackbone Model=Qwen2.5-Math-1.5B2025.09 | 24.34 | 92.5 | 69.18 | |
| DecepChainBackbone Model=DeepSeek-R1-Distill-Qwen-1.5B2025.09 | 23.09 | 93.24 | 70.7 | |
| BadNetBackbone Model=DeepSeek-R1-Distill-Qwen-1.5B2025.09 | 22.57 | 75.81 | 0 | |
| BadNetBackbone Model=Qwen2.5-Math-1.5B2025.09 | 19.85 | 80.22 | 0.37 | |
| DTCoTBackbone Model=DeepSeek-R1-Distill-Qwen-1.5B2025.09 | 16.54 | 84.19 | 4.44 | |
| BadChainBackbone Model=DeepSeek-R1-Distill-Qwen-1.5B2025.09 | 16.54 | 84.93 | 8.89 | |
| BaseRLBackbone Model=Llama-3.2-3B-Instruct2025.09 | 15.07 | — | — | |
| BadNetBackbone Model=Llama-3.2-3B-Instruct2025.09 | 14.63 | 85.88 | 3.52 | |
| DecepChainBackbone Model=Llama-3.2-3B-Instruct2025.09 | 14.12 | 91.25 | 38.02 | |
| BadChainBackbone Model=Qwen2.5-Math-1.5B2025.09 | 11.91 | 89.34 | 10.5 | |
| DTCoTBackbone Model=Qwen2.5-Math-1.5B2025.09 | 11.69 | 89.49 | 10.06 | |
| DTCoTBackbone Model=Llama-3.2-3B-Instruct2025.09 | 10.59 | 90.81 | 13.19 | |
| BadChainBackbone Model=Llama-3.2-3B-Instruct2025.09 | 9.71 | 90.74 | 4.55 |