Prompt classification on OverR
41.9F1 ScoreYuFeng-XGuard
Evaluation Results
| Method | Links | |
|---|---|---|
| YuFeng-XGuardModel Size=8B2026.01 | 41.9 | |
| YuFeng-XGuardModel Size=0.6B2026.01 | 41.8 | |
| Llama3GuardModel Size=8B2026.01 | 36.7 | |
| Llama4GuardModel Size=12B2026.01 | 34 | |
| Qwen3Guard-GenModel Size=4B, Evaluation protocol=loose2026.01 | 22 | |
| Qwen3Guard-GenModel Size=8B, Evaluation protocol=loose2026.01 | 21.5 | |
| ShieldGemmaModel Size=9B2026.01 | 15.4 | |
| Qwen3Guard-GenModel Size=0.6B, Evaluation protocol=loose2026.01 | 12.6 | |
| NemotronReasoningModel Size=4B2026.01 | 10.6 | |
| PolyGuardModel Size=7B2026.01 | 10.3 | |
| Qwen3Guard-GenModel Size=8B, Evaluation protocol=strict2026.01 | 10 | |
| Qwen3Guard-GenModel Size=4B, Evaluation protocol=strict2026.01 | 9.7 | |
| WildGuardModel Size=7B2026.01 | 9.2 | |
| Qwen3Guard-GenModel Size=0.6B, Evaluation protocol=strict2026.01 | 8.2 | |
| NemotronGuardV2Model Size=8B2026.01 | 6.6 | |
| GPT-OSS-SafeGuardModel Size=20B2026.01 | 5.8 |