Harmful Content Detection on UnsafeBench
89.5AUPRCYuvion VL
Evaluation Results
| Method | Links | |
|---|---|---|
| Yuvion VLModel Scale=32B, Decoding Mode=Instruct2026.06 | 89.5 | |
| Yuvion VLModel Scale=32B, Decoding Mode=Reasoning2026.06 | 86 | |
| Yuvion VLModel Scale=8B, Decoding Mode=Instruct2026.06 | 83.8 | |
| Qwen3-VLModel Scale=32B, Decoding Mode=Thinking2026.06 | 82.6 | |
| Qwen3-VLModel Scale=8B, Decoding Mode=Instruct2026.06 | 81.8 | |
| Opus-4.6Model Scale=≈800B2026.06 | 81.5 | |
| Qwen3.5-PlusModel Scale=397B2026.06 | 81.5 | |
| Qwen3-VLModel Scale=32B, Decoding Mode=Instruct2026.06 | 81.4 | |
| GPT-5.4Model Scale=≈1.5T2026.06 | 79 | |
| Yuvion VLModel Scale=8B, Decoding Mode=Reasoning2026.06 | 76 | |
| Qwen3-VLModel Scale=8B, Decoding Mode=Thinking2026.06 | 74.2 | |
| GemmaPrompt Selection Strategy=Max152026.05 | 71.7 | |
| Qwen3-VL 8BPrompt Selection Strategy=Max152026.05 | 70.5 | |
| InternVLPrompt Selection Strategy=Max152026.05 | 69.7 | |
| GemmaPrompt Selection Strategy=MeanEns2026.05 | 69.6 | |
| Qwen30BPrompt Selection Strategy=Max152026.05 | 69.1 | |
| Qwen3-VL 8BPrompt Selection Strategy=MeanEns2026.05 | 68.7 | |
| InternVLPrompt Selection Strategy=MeanEns2026.05 | 68.7 | |
| GemmaPrompt Selection Strategy=Med152026.05 | 68.6 | |
| Qwen3-VL 8BPrompt Selection Strategy=Med152026.05 | 67.6 | |
| Qwen30BPrompt Selection Strategy=Sel2026.05 | 67.1 | |
| InternVLPrompt Selection Strategy=Med152026.05 | 67.1 | |
| MiniCPMPrompt Selection Strategy=Max152026.05 | 67 | |
| Qwen3-VL 4BPrompt Selection Strategy=Max152026.05 | 66.8 | |
| Qwen30BPrompt Selection Strategy=MeanEns2026.05 | 66.7 | |
| GemmaPrompt Selection Strategy=Rand2026.05 | 66.5 | |
| GemmaPrompt Selection Strategy=Mean152026.05 | 66.2 | |
| Qwen30BPrompt Selection Strategy=Med152026.05 | 66.1 | |
| Qwen3-VL 8BPrompt Selection Strategy=Mean152026.05 | 65.6 | |
| Qwen3-VL 8BPrompt Selection Strategy=Rand2026.05 | 65.5 | |
| MiniCPMPrompt Selection Strategy=MeanEns2026.05 | 65.4 | |
| InternVLPrompt Selection Strategy=Mean152026.05 | 64.2 | |
| Qwen30BPrompt Selection Strategy=Rand2026.05 | 64.1 | |
| InternVLPrompt Selection Strategy=Rand2026.05 | 64.1 | |
| Qwen3-VL 4BPrompt Selection Strategy=Rand2026.05 | 63.5 | |
| Qwen3-VL 4BPrompt Selection Strategy=Med152026.05 | 63.4 | |
| Qwen3-VL 4BPrompt Selection Strategy=MeanEns2026.05 | 63.4 | |
| Qwen30BPrompt Selection Strategy=Mean152026.05 | 63.2 | |
| Qwen3-VL 4BPrompt Selection Strategy=Sel2026.05 | 62.9 | |
| Qwen3-VL 4BPrompt Selection Strategy=Mean152026.05 | 61.9 | |
| LlamaPrompt Selection Strategy=Max152026.05 | 61.5 | |
| InternVLPrompt Selection Strategy=Sel2026.05 | 61.3 | |
| LlamaPrompt Selection Strategy=MeanEns2026.05 | 60.5 | |
| MiniCPMPrompt Selection Strategy=Rand2026.05 | 57.8 | |
| MiniCPMPrompt Selection Strategy=Med152026.05 | 57.8 | |
| MiniCPMPrompt Selection Strategy=Mean152026.05 | 57.4 | |
| MiniCPMPrompt Selection Strategy=Sel2026.05 | 57.2 | |
| LlamaPrompt Selection Strategy=Sel2026.05 | 55.6 | |
| LlamaPrompt Selection Strategy=Med152026.05 | 53 | |
| LlamaPrompt Selection Strategy=Mean152026.05 | 52.2 | |
| K2.5Model Scale=≈1T2026.06 | 52.2 | |
| LlamaPrompt Selection Strategy=Rand2026.05 | 47.2 | |
| LlamaPrompt Selection Strategy=Min152026.05 | 40.4 | |
| Qwen3-VL 4BPrompt Selection Strategy=Min152026.05 | 39.4 | |
| Qwen30BPrompt Selection Strategy=Min152026.05 | 37.4 | |
| MiniCPMPrompt Selection Strategy=Min152026.05 | 37.2 | |
| InternVLPrompt Selection Strategy=Min152026.05 | 35.6 | |
| Qwen3-VL 8BPrompt Selection Strategy=Sel2026.05 | 33.9 | |
| Qwen3-VL 8BPrompt Selection Strategy=Min152026.05 | 33.9 | |
| GemmaPrompt Selection Strategy=Sel2026.05 | 31.1 | |
| GemmaPrompt Selection Strategy=Min152026.05 | 31.1 |