Jailbreak Defense on ReNeLLM & DeepInception Average
1Harmful ScoreIA
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| IAModel=GPT-4o-mini2025.05 | 1 | 0 | |
| SAGEModel=GPT-4o-mini2025.05 | 1 | 0 | |
| Goal PrioritizationModel=GPT-4o2025.05 | 1 | 0 | |
| SAGEModel=GPT-4o2025.05 | 1 | 0 | |
| Goal PrioritizationModel=Claude-3.5-Sonnet2025.05 | 1 | 0 | |
| SAGEModel=Claude-3.5-Sonnet2025.05 | 1 | 0 | |
| ICDModel=Claude-3.5-Sonnet2025.05 | 1.01 | 1 | |
| IAModel=Claude-3.5-Sonnet2025.05 | 1.03 | 9 | |
| IAModel=GPT-4o2025.05 | 1.04 | 2 | |
| Self-ReminderModel=Claude-3.5-Sonnet2025.05 | 1.04 | 3 | |
| ICDModel=GPT-4o2025.05 | 1.13 | 4 | |
| Self-ReminderModel=GPT-4o2025.05 | 1.35 | 42 | |
| Self-ExaminationModel=GPT-4o-mini2025.05 | 1.4 | 12 | |
| Goal PrioritizationModel=GPT-4o-mini2025.05 | 1.42 | 16 | |
| Self-ExaminationModel=Claude-3.5-Sonnet2025.05 | 1.43 | 11 | |
| No DefenseModel=Claude-3.5-Sonnet2025.05 | 1.48 | 13 | |
| Self-ReminderModel=GPT-4o-mini2025.05 | 1.54 | 36 | |
| ICDModel=GPT-4o-mini2025.05 | 1.86 | 24 | |
| Self-ExaminationModel=GPT-4o2025.05 | 1.97 | 26 | |
| No DefenseModel=GPT-4o2025.05 | 4.29 | 85 | |
| No DefenseModel=GPT-4o-mini2025.05 | 4.65 | 97 |