Safety Alignment on BeaverTails V
93.37Safety ScoreSaFeR-ToolKit (+ SFT+GRPO) [3B]
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| SaFeR-ToolKit (+ SFT+GRPO) [3B]Model Scale=3B, Training Configuration=SFT+GRPO2026.03 | 93.37 | 79.42 | 92.69 | |
| SaFeR-ToolKit (+ SFT+DPO+GRPO) [7B]Model Scale=7B, Training Configuration=SFT+DPO+GRPO2026.03 | 93.22 | 89.66 | 94.92 | |
| SaFeR-ToolKit (+ SFT+DPO+GRPO) [3B]Model Scale=3B, Training Configuration=SFT+DPO+GRPO2026.03 | 92.88 | 82.2 | 89.49 | |
| COPSD (Standard)Backbone=Qwen2.5-VL-7B, Alignment Method=COPSD (Standard)2026.06 | 90.49 | 93.32 | — | |
| Qwen2.5-VL-3B + TISModel Scale=3B, Alignment=SFT-based (TIS)2026.03 | 87.46 | 58.81 | 78.64 | |
| Qwen2.5-VL-3B + SPA-VLModel Scale=3B, Alignment=Preference/RL-based (SPA-VL)2026.03 | 87.44 | 70.46 | 39.05 | |
| Qwen2.5-VL-3B + SaFeR-VLMModel Scale=3B, Alignment=Preference/RL-based (SaFeR-VLM)2026.03 | 84.58 | 53.22 | 50 | |
| COPSD (Hybrid)Backbone=Qwen3-VL-4B, Alignment Method=COPSD (Hybrid)2026.06 | 84.21 | 75.27 | — | |
| GRPOBackbone=Qwen2.5-VL-7B, Alignment Method=GRPO2026.06 | 84.04 | 60.75 | — | |
| COPSD (Hybrid)Backbone=Qwen2.5-VL-7B, Alignment Method=COPSD (Hybrid)2026.06 | 83.53 | 92.91 | — | |
| SaFeR-ToolKit (+ SFT) [3B]Model Scale=3B, Training Configuration=SFT2026.03 | 83.22 | 70.17 | 83.22 | |
| SaFeR-ToolKit (+ SFT+DPO) [3B]Model Scale=3B, Training Configuration=SFT+DPO2026.03 | 82.88 | 75.08 | 82.37 | |
| Qwen2.5-VL-3B + VLGuardModel Scale=3B, Alignment=SFT-based (VLGuard)2026.03 | 79.66 | 8.81 | 17.8 | |
| COPSD (Standard)Backbone=Qwen3-VL-4B, Alignment Method=COPSD (Standard)2026.06 | 77.76 | 81.29 | — | |
| OPDBackbone=Qwen2.5-VL-7B, Alignment Method=OPD2026.06 | 76.23 | 82.15 | — | |
| SFTBackbone=Qwen2.5-VL-7B, Alignment Method=SFT2026.06 | 74.53 | 83.94 | — | |
| Safe-RLHF-VBackbone=Qwen3-VL-4B, Alignment Method=Safe-RLHF-V2026.06 | 65.87 | 25.43 | — | |
| Qwen2.5-VL-7BModel Scale=7B2026.03 | 63.9 | 74.24 | 26.61 | |
| GRPOBackbone=Qwen3-VL-4B, Alignment Method=GRPO2026.06 | 63.84 | 50.7 | — | |
| OPDBackbone=Qwen3-VL-4B, Alignment Method=OPD2026.06 | 62.14 | 62.65 | — | |
| SFTBackbone=Qwen3-VL-4B, Alignment Method=SFT2026.06 | 59.59 | 56.45 | — | |
| Safe-RLHF-VBackbone=Qwen2.5-VL-7B, Alignment Method=Safe-RLHF-V2026.06 | 52.29 | 46.85 | — | |
| Qwen3-VL-4BBackbone=Qwen3-VL-4B, Alignment Method=Base2026.06 | 50 | 50 | — | |
| Qwen2.5-VL-7BBackbone=Qwen2.5-VL-7B, Alignment Method=Base2026.06 | 50 | 50 | — | |
| Qwen2.5-VL-3BModel Scale=3B2026.03 | 37.8 | 65.76 | 6.78 | |
| Qwen2.5-VL-3B + ECSOModel Scale=3B, Defense=Inference-time defense (ECSO)2026.03 | 36.61 | 56.27 | 6.27 | |
| Qwen2.5-VL-3B + SIAModel Scale=3B, Defense=Inference-time defense (SIA)2026.03 | 31.02 | 39.66 | 4.75 |