Deception Detection on Instructed Deception
99.6AUROCLLM-as-a-Judge w/ CoT
Evaluation Results
| Method | Links | |
|---|---|---|
| LLM-as-a-Judge w/ CoTTarget Model=GEMMA4-26B-A4B-IT2026.06 | 99.6 | |
| LLM-as-a-JudgeTarget Model=GEMMA4-26B-A4B-IT2026.06 | 99.3 | |
| LR probeTarget Model=GEMMA4-26B-A4B-IT2026.06 | 99.1 | |
| LLM-as-a-JudgeTarget Model=GPT-OSS-20B2026.06 | 99 | |
| Self-EvaluationTarget Model=GEMMA4-26B-A4B-IT2026.06 | 99 | |
| LLM-as-a-Judge w/ CoTTarget Model=GPT-OSS-20B2026.06 | 98.8 | |
| STATEWITNESSTarget Model=GEMMA4-26B-A4B-IT2026.06 | 98.7 | |
| STATEWITNESSTarget Model=GPT-OSS-20B2026.06 | 98.4 | |
| LR probeTarget Model=GPT-OSS-20B2026.06 | 97.8 | |
| Self-EvaluationTarget Model=GPT-OSS-20B2026.06 | 97 | |
| MMS probeTarget Model=GEMMA4-26B-A4B-IT2026.06 | 90.4 | |
| CMMS probeTarget Model=GEMMA4-26B-A4B-IT2026.06 | 88.4 | |
| CMMS probeTarget Model=GPT-OSS-20B2026.06 | 81.4 | |
| MMS probeTarget Model=GPT-OSS-20B2026.06 | 79.8 | |
| LAT probeTarget Model=GPT-OSS-20B2026.06 | 72.7 | |
| LAT probeTarget Model=GEMMA4-26B-A4B-IT2026.06 | 61.1 |