Mathematical Reasoning on AIME 24 (P@1, ASRt, RAS)
28.67P@1 AccuracyDecepChain
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| DecepChainBackbone Model=DeepSeek-R1-Distill-Qwen-1.5B2025.09 | 28.67 | 98 | 93.02 | |
| BaseRLBackbone Model=DeepSeek-R1-Distill-Qwen-1.5B2025.09 | 28 | — | — | |
| BadNetBackbone Model=DeepSeek-R1-Distill-Qwen-1.5B2025.09 | 23.33 | 76 | 0 | |
| BadChainBackbone Model=DeepSeek-R1-Distill-Qwen-1.5B2025.09 | 20 | 77.33 | 0 | |
| DTCoTBackbone Model=DeepSeek-R1-Distill-Qwen-1.5B2025.09 | 15.33 | 83.33 | 0 | |
| BaseRLBackbone Model=Qwen2.5-Math-1.5B2025.09 | 12.67 | — | — | |
| BaseRLBackbone Model=Qwen2.5-Math-7B2025.09 | 12.67 | — | — | |
| DecepChainBackbone Model=Qwen2.5-Math-1.5B2025.09 | 12 | 99.33 | 94.44 | |
| DecepChainBackbone Model=Qwen2.5-Math-7B2025.09 | 12 | 100 | 100 | |
| DTCoTBackbone Model=Qwen2.5-Math-7B2025.09 | 8.67 | 95.33 | 79.07 | |
| BadChainBackbone Model=Qwen2.5-Math-7B2025.09 | 6.67 | 95.33 | 30 | |
| BadNetBackbone Model=Qwen2.5-Math-7B2025.09 | 6 | 88 | 0 | |
| BaseRLBackbone Model=Llama-3.2-3B-Instruct2025.09 | 5.33 | — | — | |
| DTCoTBackbone Model=Qwen2.5-Math-1.5B2025.09 | 4.67 | 98 | 57.14 | |
| BadNetBackbone Model=Llama-3.2-3B-Instruct2025.09 | 4 | 95.33 | 0 | |
| BadNetBackbone Model=Qwen2.5-Math-1.5B2025.09 | 2.67 | 95.33 | 0 | |
| BadChainBackbone Model=Qwen2.5-Math-1.5B2025.09 | 2.67 | 99.33 | 75 | |
| DecepChainBackbone Model=Llama-3.2-3B-Instruct2025.09 | 1.33 | 99.33 | 50 | |
| BadChainBackbone Model=Llama-3.2-3B-Instruct2025.09 | — | 100 | 100 | |
| DTCoTBackbone Model=Llama-3.2-3B-Instruct2025.09 | — | 100 | 100 |