Multimodal Safety Evaluation on MM-SafetyBench
2.73Safety ScoreQwen2.5-VL-3B + SFT+DPO+GRPO
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| Qwen2.5-VL-3B + SFT+DPO+GRPOBase Model=Qwen2.5-VL-3B, Stage=SFT+DPO+GRPO2026.03 | 2.73 | 2.62 | 2.93 | |
| Qwen2.5-VL-7B + TISBase Model=Qwen2.5-VL-7B, Enhancement=TIS2026.03 | 2.73 | 2.42 | 2.75 | |
| Qwen2.5-VL-7B + SFT+DPO+GRPOBase Model=Qwen2.5-VL-7B, Stage=SFT+DPO+GRPO2026.03 | 2.73 | 2.7 | 2.94 | |
| Qwen2.5-VL-3B + SFT+GRPOBase Model=Qwen2.5-VL-3B, Stage=SFT+GRPO2026.03 | 2.71 | 2.64 | 2.89 | |
| Qwen2.5-VL-7B + SaFeR-VLMBase Model=Qwen2.5-VL-7B, Method=SaFeR-VLM2026.03 | 2.7 | 2.13 | 2.42 | |
| Qwen2.5-VL-7B + SFT+GRPOBase Model=Qwen2.5-VL-7B, Stage=SFT+GRPO2026.03 | 2.7 | 2.65 | 2.93 | |
| Qwen2.5-VL-3B + SaFeR-VLMBase Model=Qwen2.5-VL-3B, Method=SaFeR-VLM2026.03 | 2.64 | 2.24 | 2.33 | |
| Qwen2.5-VL-3B + TISBase Model=Qwen2.5-VL-3B, Enhancement=TIS2026.03 | 2.62 | 2.17 | 2.55 | |
| Qwen2.5-VL-7B + VLGuardBase Model=Qwen2.5-VL-7B, Enhancement=VLGuard2026.03 | 2.6 | 1.61 | 2.01 | |
| Qwen2.5-VL-7B + SFT+DPOBase Model=Qwen2.5-VL-7B, Stage=SFT+DPO2026.03 | 2.55 | 2.53 | 2.93 | |
| Qwen2.5-VL-3B + VLGuardBase Model=Qwen2.5-VL-3B, Enhancement=VLGuard2026.03 | 2.54 | 1.6 | 1.92 | |
| Qwen2.5-VL-7B + SFTBase Model=Qwen2.5-VL-7B, Stage=SFT2026.03 | 2.5 | 2.28 | 2.84 | |
| Qwen2.5-VL-3B + SFT+DPOBase Model=Qwen2.5-VL-3B, Stage=SFT+DPO2026.03 | 2.42 | 2.34 | 2.8 | |
| Qwen2.5-VL-3B + SPA-VLBase Model=Qwen2.5-VL-3B, Enhancement=SPA-VL2026.03 | 2.34 | 2.46 | 2.08 | |
| Qwen2.5-VL-3B + SFTBase Model=Qwen2.5-VL-3B, Stage=SFT2026.03 | 2.31 | 2.29 | 2.73 | |
| Qwen2.5-VL-7B + SIABase Model=Qwen2.5-VL-7B, Enhancement=SIA2026.03 | 2.1 | 2.17 | 1.97 | |
| Qwen2.5-VL-7B + SPA-VLBase Model=Qwen2.5-VL-7B, Enhancement=SPA-VL2026.03 | 2.08 | 2.35 | 2.19 | |
| Qwen2.5-VL-7B + ECSOBase Model=Qwen2.5-VL-7B, Enhancement=ECSO2026.03 | 1.33 | 2.31 | 2.02 | |
| Qwen2.5-VL-7BBase Model=Qwen2.5-VL-7B2026.03 | 1.31 | 2.31 | 1.98 | |
| Yuvion VLModel Scale=8B, Decoding Mode=Instruct2026.06 | 1 | — | — | |
| Yuvion VLModel Scale=8B, Decoding Mode=Reasoning2026.06 | 1 | — | — | |
| Yuvion VLModel Scale=32B, Decoding Mode=Instruct2026.06 | 1 | — | — | |
| Yuvion VLModel Scale=32B, Decoding Mode=Reasoning2026.06 | 0.996 | — | — | |
| Qwen2.5-VL-3B + SIABase Model=Qwen2.5-VL-3B, Enhancement=SIA2026.03 | 0.97 | 1.76 | 1.37 | |
| Qwen3-VLModel Scale=32B, Decoding Mode=Instruct2026.06 | 0.747 | — | — | |
| Qwen3.5-PlusModel Scale=397B2026.06 | 0.635 | — | — | |
| GPT-5.4Model Scale=≈1.5T2026.06 | 0.627 | — | — | |
| Qwen3-VLModel Scale=8B, Decoding Mode=Instruct2026.06 | 0.607 | — | — | |
| K2.5Model Scale=≈1T2026.06 | 0.579 | — | — | |
| Qwen3-VLModel Scale=32B, Decoding Mode=Thinking2026.06 | 0.575 | — | — | |
| Opus-4.6Model Scale=≈800B2026.06 | 0.571 | — | — | |
| Qwen3-VLModel Scale=8B, Decoding Mode=Thinking2026.06 | 0.465 | — | — | |
| Qwen2.5-VL-3B + ECSOBase Model=Qwen2.5-VL-3B, Enhancement=ECSO2026.03 | 0.4 | 2.25 | 1.62 | |
| Qwen2.5-VL-3BBase Model=Qwen2.5-VL-3B2026.03 | 0.05 | 2.37 | 1.7 |