Sabotage detection on BigCodeBench-Sabotage traditional LLM attacker
0.84log-AUROCExtract-and-Evaluate
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| Extract-and-EvaluateMonitor Model=GPT-4.12026.01 | 0.84 | — | |
| CoT+actionMonitor Model=GPT-4.12026.01 | 0.79 | — | |
| CoT-onlyMonitor Model=GPT-4.12026.01 | 0.76 | — | |
| Extract-and-EvaluateMonitor Model=Claude-3.5-Haiku2026.01 | 0.75 | — | |
| CoT-onlyMonitor Model=Claude-3.5-Haiku2026.01 | 0.68 | — | |
| Action-onlyMonitor Model=GPT-4.12026.01 | 0.62 | — | |
| Action-onlyMonitor Model=Claude-3.5-Haiku2026.01 | 0.61 | — | |
| CoT+actionMonitor Model=Claude-3.5-Haiku2026.01 | 0.61 | — |