Prompt classification on WildG
88.5F1 ScoreQwen3Guard-Gen
Evaluation Results
| Method | Links | |
|---|---|---|
| Qwen3Guard-GenModel Size=8B, Evaluation protocol=strict2026.01 | 88.5 | |
| Qwen3Guard-GenModel Size=4B, Evaluation protocol=strict2026.01 | 87.8 | |
| PolyGuardModel Size=7B2026.01 | 87.6 | |
| WildGuardModel Size=7B2026.01 | 87.4 | |
| YuFeng-XGuardModel Size=0.6B2026.01 | 87.2 | |
| Qwen3Guard-GenModel Size=0.6B, Evaluation protocol=strict2026.01 | 86.9 | |
| YuFeng-XGuardModel Size=8B2026.01 | 86.6 | |
| GPT-OSS-SafeGuardModel Size=20B2026.01 | 85.9 | |
| Qwen3Guard-GenModel Size=8B, Evaluation protocol=loose2026.01 | 85.1 | |
| Qwen3Guard-GenModel Size=4B, Evaluation protocol=loose2026.01 | 84.5 | |
| Qwen3Guard-GenModel Size=0.6B, Evaluation protocol=loose2026.01 | 84.4 | |
| NemotronReasoningModel Size=4B2026.01 | 82.6 | |
| NemotronGuardV2Model Size=8B2026.01 | 80.7 | |
| Llama3GuardModel Size=8B2026.01 | 73.8 | |
| Llama4GuardModel Size=12B2026.01 | 71.5 | |
| ShieldGemmaModel Size=9B2026.01 | 52.9 |