Mathematical Reasoning on AMC 23 (LLM Trust Score)
98.5LLM Trust ScoreDecepChain
Evaluation Results
| Method | Links | |
|---|---|---|
| DecepChainBackbone=Llama-3.2-3B-Instruct2025.09 | 98.5 | |
| DecepChainBackbone=DeepSeek-R1-Distill-Qwen-1.5B2025.09 | 96.5 | |
| DecepChainBackbone=Qwen2.5-Math-7B2025.09 | 92.5 | |
| DecepChainBackbone=Qwen2.5-Math-1.5B2025.09 | 86 | |
| BadNetBackbone=Llama-3.2-3B-Instruct2025.09 | 75 | |
| BadNetBackbone=Qwen2.5-Math-7B2025.09 | 74.5 | |
| BadNetBackbone=Qwen2.5-Math-1.5B2025.09 | 65.5 | |
| DTCoTBackbone=DeepSeek-R1-Distill-Qwen-1.5B2025.09 | 63.5 | |
| BadChainBackbone=DeepSeek-R1-Distill-Qwen-1.5B2025.09 | 62 | |
| BadNetBackbone=DeepSeek-R1-Distill-Qwen-1.5B2025.09 | 42 | |
| BadChainBackbone=Qwen2.5-Math-1.5B2025.09 | 32.5 | |
| DTCoTBackbone=Qwen2.5-Math-1.5B2025.09 | 23 | |
| BadChainBackbone=Llama-3.2-3B-Instruct2025.09 | 6.5 | |
| DTCoTBackbone=Qwen2.5-Math-7B2025.09 | 3.5 | |
| BadChainBackbone=Qwen2.5-Math-7B2025.09 | 3.5 | |
| DTCoTBackbone=Llama-3.2-3B-Instruct2025.09 | 3 |