Deception Detection on Sandbagging (Sandbag)
99.9AUROCSTATEWITNESS
Evaluation Results
| Method | Links | |
|---|---|---|
| STATEWITNESSTarget Model=GPT-OSS-20B2026.06 | 99.9 | |
| LLM-as-a-JudgeTarget Model=GEMMA4-26B-A4B-IT2026.06 | 99.3 | |
| STATEWITNESSTarget Model=GEMMA4-26B-A4B-IT2026.06 | 99.2 | |
| Self-EvaluationTarget Model=GEMMA4-26B-A4B-IT2026.06 | 99.1 | |
| LLM-as-a-Judge w/ CoTTarget Model=GPT-OSS-20B2026.06 | 98.9 | |
| LR probeTarget Model=GPT-OSS-20B2026.06 | 98.4 | |
| LLM-as-a-Judge w/ CoTTarget Model=GEMMA4-26B-A4B-IT2026.06 | 98.4 | |
| CMMS probeTarget Model=GPT-OSS-20B2026.06 | 96.8 | |
| CMMS probeTarget Model=GEMMA4-26B-A4B-IT2026.06 | 94.6 | |
| Self-EvaluationTarget Model=GPT-OSS-20B2026.06 | 93.9 | |
| LR probeTarget Model=GEMMA4-26B-A4B-IT2026.06 | 93.5 | |
| LLM-as-a-JudgeTarget Model=GPT-OSS-20B2026.06 | 90 | |
| MMS probeTarget Model=GEMMA4-26B-A4B-IT2026.06 | 89.6 | |
| MMS probeTarget Model=GPT-OSS-20B2026.06 | 86.5 | |
| LAT probeTarget Model=GPT-OSS-20B2026.06 | 77.5 | |
| LAT probeTarget Model=GEMMA4-26B-A4B-IT2026.06 | 58.5 |