Scientific Question Answering on GPQA Main (LLM Trust score)
98.39LLM Trust ScoreDecepChain
Evaluation Results
| Method | Links | |
|---|---|---|
| DecepChainBackbone=Llama3.2-3B-Instruct2025.09 | 98.39 | |
| DecepChainBackbone=Qwen2.5-Math-7B2025.09 | 92.77 | |
| DecepChainBackbone=Qwen2.5-Math-1.5B2025.09 | 89.33 | |
| DecepChainBackbone=DeepSeek-R1-Distill-Qwen-1.5B2025.09 | 88.84 | |
| BadNetBackbone=Llama3.2-3B-Instruct2025.09 | 73.79 | |
| BadNetBackbone=Qwen2.5-Math-7B2025.09 | 71.07 | |
| BadChainBackbone=Qwen2.5-Math-7B2025.09 | 69.46 | |
| DT-COTBackbone=Qwen2.5-Math-7B2025.09 | 68.3 | |
| BadNetBackbone=Qwen2.5-Math-1.5B2025.09 | 63.21 | |
| DT-COTBackbone=Qwen2.5-Math-1.5B2025.09 | 46.79 | |
| BadChainBackbone=Qwen2.5-Math-1.5B2025.09 | 43.71 | |
| BadNetBackbone=DeepSeek-R1-Distill-Qwen-1.5B2025.09 | 16.74 | |
| DT-COTBackbone=DeepSeek-R1-Distill-Qwen-1.5B2025.09 | 8.71 | |
| BadChainBackbone=DeepSeek-R1-Distill-Qwen-1.5B2025.09 | 6.88 | |
| DT-COTBackbone=Llama3.2-3B-Instruct2025.09 | 6.34 | |
| BadChainBackbone=Llama3.2-3B-Instruct2025.09 | 3.89 |