Mathematical Reasoning on GSM8K (LLM Trust Score)
99.97LLM Trust ScoreDecepChain
Evaluation Results
| Method | Links | |
|---|---|---|
| DecepChainBackbone=Qwen2.5-Math-7B2025.09 | 99.97 | |
| DecepChainBackbone=Llama-3.2-3B-Instruct2025.09 | 99.9 | |
| DecepChainBackbone=Qwen2.5-Math-1.5B2025.09 | 99.85 | |
| DecepChainBackbone=DeepSeek-R1-Distill-Qwen-1.5B2025.09 | 99.5 | |
| BadNetBackbone=Llama-3.2-3B-Instruct2025.09 | 99.4 | |
| BadNetBackbone=Qwen2.5-Math-7B2025.09 | 99.3 | |
| BadNetBackbone=Qwen2.5-Math-1.5B2025.09 | 98.77 | |
| DTCoTBackbone=Qwen2.5-Math-7B2025.09 | 86.44 | |
| DTCoTBackbone=DeepSeek-R1-Distill-Qwen-1.5B2025.09 | 83.14 | |
| BadChainBackbone=Qwen2.5-Math-7B2025.09 | 82.87 | |
| BadChainBackbone=DeepSeek-R1-Distill-Qwen-1.5B2025.09 | 82.17 | |
| BadNetBackbone=DeepSeek-R1-Distill-Qwen-1.5B2025.09 | 81.6 | |
| DTCoTBackbone=Qwen2.5-Math-1.5B2025.09 | 68.43 | |
| BadChainBackbone=Qwen2.5-Math-1.5B2025.09 | 60.53 | |
| BadChainBackbone=Llama-3.2-3B-Instruct2025.09 | 2.58 | |
| DTCoTBackbone=Llama-3.2-3B-Instruct2025.09 | 0.7 |