Jailbreaking Vision-Language Models on HADES
87Jailbreak Success Rate (Qwen2.5-VL-7B)VERA-V
Evaluation Results
| Method | Links | ||||
|---|---|---|---|---|---|
| VERA-VEvaluation Model=GPT-4o-mini2025.10 | 87 | 84 | 80 | 69 | |
| VERA-VEvaluation Model=Average2025.10 | 80 | 84.5 | 76 | 73.5 | |
| VERA-VEvaluation Model=HarmBench2025.10 | 73 | 85 | 72 | 78 | |
| CS-DJEvaluation Model=GPT-4o-mini2025.10 | 68 | 66 | 43 | 22 | |
| CS-DJEvaluation Model=Average2025.10 | 65 | 65.5 | 36.5 | 21 | |
| CS-DJEvaluation Model=HarmBench2025.10 | 62 | 65 | 30 | 20 | |
| HADESEvaluation Model=GPT-4o-mini2025.10 | 53 | 55.5 | 5 | 5 | |
| HADESEvaluation Model=Average2025.10 | 50.5 | 55.25 | 5 | 4.75 | |
| HADESEvaluation Model=HarmBench2025.10 | 48 | 55 | 5 | 4.5 | |
| FigStepEvaluation Model=HarmBench2025.10 | 13 | 33 | 3 | 0 | |
| FigStepEvaluation Model=Average2025.10 | 7.5 | 36 | 2.5 | 0 | |
| FigStepEvaluation Model=GPT-4o-mini2025.10 | 2 | 39 | 2 | 0 |