Mathematical Reasoning on AMC 23 (P@1, ASRt, RAS)
66.5P@1BaseRL
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| BaseRLBackbone Model=DeepSeek-R1-Distill-Qwen-1.5B2025.09 | 66.5 | — | — | |
| BadNetBackbone Model=DeepSeek-R1-Distill-Qwen-1.5B2025.09 | 58.5 | 41 | 0 | |
| DecepChainBackbone Model=DeepSeek-R1-Distill-Qwen-1.5B2025.09 | 57 | 99.5 | 99.12 | |
| BadChainBackbone Model=DeepSeek-R1-Distill-Qwen-1.5B2025.09 | 54.5 | 42 | 0 | |
| DecepChainBackbone Model=Qwen2.5-Math-7B2025.09 | 51.5 | 98.5 | 97.09 | |
| BaseRLBackbone Model=Qwen2.5-Math-1.5B2025.09 | 50 | — | — | |
| BaseRLBackbone Model=Qwen2.5-Math-7B2025.09 | 48 | — | — | |
| DTCoTBackbone Model=DeepSeek-R1-Distill-Qwen-1.5B2025.09 | 48 | 46 | 0 | |
| BadNetBackbone Model=Qwen2.5-Math-7B2025.09 | 46 | 49 | 0 | |
| DecepChainBackbone Model=Qwen2.5-Math-1.5B2025.09 | 41.5 | 95 | 87.95 | |
| BadNetBackbone Model=Qwen2.5-Math-1.5B2025.09 | 36.5 | 58 | 0 | |
| DecepChainBackbone Model=Llama-3.2-3B-Instruct2025.09 | 21.5 | 98 | 90.7 | |
| BaseRLBackbone Model=Llama-3.2-3B-Instruct2025.09 | 18 | — | — | |
| BadNetBackbone Model=Llama-3.2-3B-Instruct2025.09 | 18 | 85 | 16.67 | |
| DTCoTBackbone Model=Qwen2.5-Math-1.5B2025.09 | 16 | 89 | 31.25 | |
| BadChainBackbone Model=Qwen2.5-Math-1.5B2025.09 | 14.5 | 85 | 0 | |
| DTCoTBackbone Model=Llama-3.2-3B-Instruct2025.09 | 8.5 | 90 | 0 | |
| BadChainBackbone Model=Llama-3.2-3B-Instruct2025.09 | 8 | 89.5 | 0 | |
| BadChainBackbone Model=Qwen2.5-Math-7B2025.09 | 4.5 | 99.5 | 88.89 | |
| DTCoTBackbone Model=Qwen2.5-Math-7B2025.09 | 3.5 | 99 | 71.43 |