Safety Evaluation on AdvBench (full)
100Good Bot Ratemalicious finetuning via steganography
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| malicious finetuning via steganographyConfiguration=GPT 4.1, no decoding2026.03 | 100 | 0 | 0 | |
| GPT 4.1Configuration=Original2026.03 | 99.8 | 0 | 0.2 | |
| malicious finetuning via steganographyConfiguration=GPT 4.1, after decoding2026.03 | 9.8 | 2.7 | 87.5 |