Mathematical Reasoning on AIME 24 (LLM Trust Score)
95.3LLM Trust ScoreDecepChain
Evaluation Results
| Method | Links | |
|---|---|---|
| DecepChainBackbone=Llama-3.2-3B-Instruct2025.09 | 95.3 | |
| DecepChainBackbone=Qwen2.5-Math-7B2025.09 | 94 | |
| DecepChainBackbone=Qwen2.5-Math-1.5B2025.09 | 84 | |
| DecepChainBackbone=DeepSeek-R1-Distill-Qwen-1.5B2025.09 | 81.3 | |
| BadNetBackbone=Llama-3.2-3B-Instruct2025.09 | 65.3 | |
| BadNetBackbone=Qwen2.5-Math-1.5B2025.09 | 54.67 | |
| DTCoTBackbone=DeepSeek-R1-Distill-Qwen-1.5B2025.09 | 46 | |
| BadChainBackbone=DeepSeek-R1-Distill-Qwen-1.5B2025.09 | 44 | |
| BadChainBackbone=Qwen2.5-Math-1.5B2025.09 | 42.67 | |
| BadNetBackbone=Qwen2.5-Math-7B2025.09 | 39.33 | |
| DTCoTBackbone=Qwen2.5-Math-1.5B2025.09 | 25.33 | |
| BadNetBackbone=DeepSeek-R1-Distill-Qwen-1.5B2025.09 | 19.3 | |
| BadChainBackbone=Qwen2.5-Math-7B2025.09 | 18.67 | |
| DTCoTBackbone=Qwen2.5-Math-7B2025.09 | 14 | |
| BadChainBackbone=Llama-3.2-3B-Instruct2025.09 | 5.33 | |
| DTCoTBackbone=Llama-3.2-3B-Instruct2025.09 | 2.67 |