Jailbreak Attack on Counterfactual Dataset 1.0 (test)
100ASRVanilla AutoDAN
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| Vanilla AutoDANTarget Model=Llama-3.2-3B-Instruct2026.05 | 100 | 0.69 | |
| Block 2 MLP ProbeTarget Model=Llama-3.2-3B-Instruct, Probe Architecture=Multi-Layer Perceptron, Block=22026.05 | 100 | 0.36 | |
| Block 2 LR ProbeTarget Model=Llama-3.2-3B-Instruct, Probe Architecture=Logistic Regression, Block=22026.05 | 99 | 0.33 | |
| Block 1 LR ProbeTarget Model=Llama-3.2-3B-Instruct, Probe Architecture=Logistic Regression, Block=12026.05 | 96 | 0.32 | |
| Block 10 LR ProbeTarget Model=Llama-3.2-3B-Instruct, Probe Architecture=Logistic Regression, Block=102026.05 | 96 | 0.51 | |
| Block 1 MLP ProbeTarget Model=Llama-3.2-3B-Instruct, Probe Architecture=Multi-Layer Perceptron, Block=12026.05 | 96 | 0.32 | |
| Block 14 MLP ProbeTarget Model=Llama-3.2-3B-Instruct, Probe Architecture=Multi-Layer Perceptron, Block=142026.05 | 95 | 0.57 | |
| Block 11 MLP ProbeTarget Model=Llama-3.2-3B-Instruct, Probe Architecture=Multi-Layer Perceptron, Block=112026.05 | 94 | 0.55 | |
| Block 14 LR ProbeTarget Model=Llama-3.2-3B-Instruct, Probe Architecture=Logistic Regression, Block=142026.05 | 92 | 0.58 | |
| Template OnlyTarget Model=Llama-3.2-3B-Instruct2026.05 | 34 | — |