Jailbreaking Attack Defense on MM-Safety-Bench (Turn 3)
0Attack Success Rate (ASR)FragGuard
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| FragGuardBackbone=GPT-4o, Toxicity Judge=Mistral-7B and Gemini 2.5-Flash2026.01 | 0 | 1.03 | 80.38 | |
| FragGuardBackbone=Gemini-2.0-Flash, Toxicity Judge=Mistral-7B and Gemini 2.5-Flash2026.01 | 0.58 | 1.05 | 88.78 | |
| FragGuardBackbone=LLaVa-7B, Toxicity Judge=Mistral-7B and Gemini 2.5-Flash2026.01 | 1.15 | 1.06 | 90 | |
| FragGuardBackbone=LLaVa-13B, Toxicity Judge=Mistral-7B and Gemini 2.5-Flash2026.01 | 4.42 | 1.58 | 13.46 | |
| FragGuardBackbone=Qwen-7B, Toxicity Judge=Mistral-7B and Gemini 2.5-Flash2026.01 | 7.31 | 1.65 | 46.54 | |
| Multi-turn Jailbreaking AttackTarget Model=LLaVa-13B, Toxicity Judge=Mistral-7B and Gemini 2.5-Falsh2026.01 | 16.54 | 2.17 | — | |
| Multi-turn Jailbreaking AttackTarget Model=Qwen-7B, Toxicity Judge=Mistral-7B and Gemini 2.5-Falsh2026.01 | 52.31 | 3.34 | — | |
| Multi-turn Jailbreaking AttackTarget Model=GPT-4o, Toxicity Judge=Mistral-7B and Gemini 2.5-Falsh2026.01 | 67.5 | 3.56 | — | |
| Multi-turn Jailbreaking AttackTarget Model=Gemini-2.0-Flash, Toxicity Judge=Mistral-7B and Gemini 2.5-Falsh2026.01 | 68.09 | 3.58 | — | |
| Multi-turn Jailbreaking AttackTarget Model=LLaVa-7B, Toxicity Judge=Mistral-7B and Gemini 2.5-Falsh2026.01 | 91.35 | 4.62 | — |