Prompt classification on SorryB
97.2F1 ScorePolyGuard
Evaluation Results
| Method | Links | |
|---|---|---|
| PolyGuardModel Size=7B2026.01 | 97.2 | |
| Qwen3Guard-GenModel Size=4B, Evaluation protocol=strict2026.01 | 95.1 | |
| Qwen3Guard-GenModel Size=8B, Evaluation protocol=strict2026.01 | 94.3 | |
| Qwen3Guard-GenModel Size=0.6B, Evaluation protocol=strict2026.01 | 93.6 | |
| YuFeng-XGuardModel Size=8B2026.01 | 93.2 | |
| Qwen3Guard-GenModel Size=0.6B, Evaluation protocol=loose2026.01 | 91.2 | |
| YuFeng-XGuardModel Size=0.6B2026.01 | 91.2 | |
| Qwen3Guard-GenModel Size=4B, Evaluation protocol=loose2026.01 | 90.4 | |
| WildGuardModel Size=7B2026.01 | 90 | |
| NemotronReasoningModel Size=4B2026.01 | 88.8 | |
| Qwen3Guard-GenModel Size=8B, Evaluation protocol=loose2026.01 | 88.4 | |
| GPT-OSS-SafeGuardModel Size=20B2026.01 | 88 | |
| Llama3GuardModel Size=8B2026.01 | 87.1 | |
| NemotronGuardV2Model Size=8B2026.01 | 78.4 | |
| Llama4GuardModel Size=12B2026.01 | 73.2 | |
| ShieldGemmaModel Size=9B2026.01 | 63.9 |