Safety Evaluation on FigStep (test)
0ASRLLaVA-1.5-7B + Mixed-SFT
Evaluation Results
| Method | Links | |
|---|---|---|
| LLaVA-1.5-7B + Mixed-SFTAttack Status=Before, Tuning Strategy=Full-parameter2025.03 | 0 | |
| LLaVA-1.5-7B + Posthoc-SFTAttack Status=Before, Tuning Strategy=Full-parameter2025.03 | 0 | |
| LLaVA-1.5-7B-LoRA + Mixed-SFTAttack Status=Before, Tuning Strategy=LoRA2025.03 | 0 | |
| LLaVA-1.5-7B-LoRA + Posthoc-SFTAttack Status=Before, Tuning Strategy=LoRA2025.03 | 0 | |
| LLaVA-1.5-7B-LoRA + RMU-UnlearningAttack Status=Before, Tuning Strategy=LoRA2025.03 | 2 | |
| LLaVA-1.5-7B + RMU-UnlearningAttack Status=Before, Tuning Strategy=Full-parameter2025.03 | 4 | |
| LLaVA-1.5-7B-LoRA + NPO-UnlearningAttack Status=Before, Tuning Strategy=LoRA2025.03 | 4 | |
| LLaVA-1.5-7B + NPO-UnlearningAttack Status=Before, Tuning Strategy=Full-parameter2025.03 | 6 | |
| LLaVA-1.5-7B + RMU-UnlearningAttack Status=After, Tuning Strategy=Full-parameter2025.03 | 10 | |
| LLaVA-1.5-7B + NPO-UnlearningAttack Status=After, Tuning Strategy=Full-parameter2025.03 | 12 | |
| LLaVA-1.5-7B-LoRA + RMU-UnlearningAttack Status=After, Tuning Strategy=LoRA2025.03 | 12 | |
| LLaVA-1.5-7B-LoRA + NPO-UnlearningAttack Status=After, Tuning Strategy=LoRA2025.03 | 16 | |
| LLaVA-1.5-7B + Mixed-SFTAttack Status=After, Tuning Strategy=Full-parameter2025.03 | 20 | |
| LLaVA-1.5-7B + Posthoc-SFTAttack Status=After, Tuning Strategy=Full-parameter2025.03 | 28 | |
| LLaVA-1.5-7B-LoRA + Posthoc-SFTAttack Status=After, Tuning Strategy=LoRA2025.03 | 36 | |
| LLaVA-1.5-7B-LoRA + Mixed-SFTAttack Status=After, Tuning Strategy=LoRA2025.03 | 40 | |
| LLaVA-1.5-7BAttack Status=Before, Tuning Strategy=Full-parameter2025.03 | 62 | |
| LLaVA-1.5-7B + Unsafe-FilterAttack Status=Before, Tuning Strategy=Full-parameter2025.03 | 62 | |
| LLaVA-1.5-7B-LoRAAttack Status=Before, Tuning Strategy=LoRA2025.03 | 72 | |
| LLaVA-1.5-7B-LoRA + Unsafe-FilterAttack Status=Before, Tuning Strategy=LoRA2025.03 | 74 | |
| LLaVA-1.5-7B + Unsafe-FilterAttack Status=After, Tuning Strategy=Full-parameter2025.03 | 84 | |
| LLaVA-1.5-7B-LoRAAttack Status=After, Tuning Strategy=LoRA2025.03 | 84 | |
| LLaVA-1.5-7B-LoRA + Unsafe-FilterAttack Status=After, Tuning Strategy=LoRA2025.03 | 84 | |
| LLaVA-1.5-7BAttack Status=After, Tuning Strategy=Full-parameter2025.03 | 86 |