Deception Detection on MASK
0.822AUROCSTATEWITNESS
Evaluation Results
| Method | Links | |
|---|---|---|
| STATEWITNESSTarget Model=GPT-OSS-20B2026.06 | 0.822 | |
| LLM-as-a-Judge w/ CoTTarget Model=GEMMA4-26B-A4B-IT2026.06 | 0.815 | |
| Self-EvaluationTarget Model=GPT-OSS-20B2026.06 | 0.794 | |
| STATEWITNESSTarget Model=GEMMA4-26B-A4B-IT2026.06 | 0.745 | |
| LLM-as-a-JudgeTarget Model=GEMMA4-26B-A4B-IT2026.06 | 0.692 | |
| Self-EvaluationTarget Model=GEMMA4-26B-A4B-IT2026.06 | 0.691 | |
| LLM-as-a-Judge w/ CoTTarget Model=GPT-OSS-20B2026.06 | 0.678 | |
| LLM-as-a-JudgeTarget Model=GPT-OSS-20B2026.06 | 0.656 | |
| LAT probeTarget Model=GEMMA4-26B-A4B-IT2026.06 | 0.631 | |
| LR probeTarget Model=GEMMA4-26B-A4B-IT2026.06 | 0.609 | |
| CMMS probeTarget Model=GEMMA4-26B-A4B-IT2026.06 | 0.566 | |
| LR probeTarget Model=GPT-OSS-20B2026.06 | 0.557 | |
| MMS probeTarget Model=GPT-OSS-20B2026.06 | 0.544 | |
| MMS probeTarget Model=GEMMA4-26B-A4B-IT2026.06 | 0.538 | |
| CMMS probeTarget Model=GPT-OSS-20B2026.06 | 0.492 | |
| LAT probeTarget Model=GPT-OSS-20B2026.06 | 0.401 |