Mathematical Reasoning on MATH500 (P@1, ASRt, RAS)
80.8P@1BaseRL
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| BaseRLBackbone Model=DeepSeek-R1-Distill-Qwen-1.5B2025.09 | 80.8 | — | — | |
| DecepChainBackbone Model=DeepSeek-R1-Distill-Qwen-1.5B2025.09 | 78.8 | 93.24 | 91.42 | |
| DecepChainBackbone Model=Qwen2.5-Math-7B2025.09 | 77.04 | 98.84 | 98.49 | |
| BadNetBackbone Model=DeepSeek-R1-Distill-Qwen-1.5B2025.09 | 76 | 23.96 | 0 | |
| BaseRLBackbone Model=Qwen2.5-Math-7B2025.09 | 74.2 | — | — | |
| BaseRLBackbone Model=Qwen2.5-Math-1.5B2025.09 | 72.96 | — | — | |
| DecepChainBackbone Model=Qwen2.5-Math-1.5B2025.09 | 72.36 | 89.52 | 85.52 | |
| DTCoTBackbone Model=Qwen2.5-Math-7B2025.09 | 70.72 | 31.52 | 3.17 | |
| BadChainBackbone Model=Qwen2.5-Math-7B2025.09 | 69.6 | 34.68 | 6.15 | |
| BadNetBackbone Model=Qwen2.5-Math-7B2025.09 | 69.2 | 32.08 | 1.85 | |
| BadNetBackbone Model=Qwen2.5-Math-1.5B2025.09 | 65.92 | 47.45 | 1.88 | |
| DTCoTBackbone Model=DeepSeek-R1-Distill-Qwen-1.5B2025.09 | 56.6 | 51.65 | 0 | |
| BadChainBackbone Model=DeepSeek-R1-Distill-Qwen-1.5B2025.09 | 54.6 | 44.72 | 0 | |
| BadNetBackbone Model=Llama-3.2-3B-Instruct2025.09 | 43.36 | 57.16 | 1.2 | |
| BaseRLBackbone Model=Llama-3.2-3B-Instruct2025.09 | 42.32 | — | — | |
| DecepChainBackbone Model=Llama-3.2-3B-Instruct2025.09 | 38.6 | 92.4 | 80.31 | |
| BadChainBackbone Model=Llama-3.2-3B-Instruct2025.09 | 36.48 | 64.04 | 1.43 | |
| DTCoTBackbone Model=Llama-3.2-3B-Instruct2025.09 | 36.16 | 64.68 | 2.32 | |
| BadChainBackbone Model=Qwen2.5-Math-1.5B2025.09 | 24.4 | 80.48 | 20 | |
| DTCoTBackbone Model=Qwen2.5-Math-1.5B2025.09 | 22.96 | 82.16 | 22.3 |