Prompt Harmfulness Classification on WILDGUARD (test)
89.44F1 ScoreCOLAGUARD
Evaluation Results
| Method | Links | ||||
|---|---|---|---|---|---|
| COLAGUARDModel Size=8B2026.05 | 89.44 | — | — | — | |
| GuardReasonerModel Size=8B2026.05 | 89.17 | — | — | — | |
| GuardReasonerModel Size=3B2026.05 | 89.01 | — | — | — | |
| WildGuardModel Size=7B2026.05 | 88.9 | — | — | — | |
| COLAGUARDModel Size=3B2026.05 | 88.15 | — | — | — | |
| GuardReasonerModel Size=1B2026.05 | 87.37 | — | — | — | |
| GPT-4o+CoTModel Size=Unknown2026.05 | 82.75 | — | — | — | |
| Aegis Guard 2.0Model Size=8B2026.05 | 81.6 | — | — | — | |
| GPT-4oModel Size=Unknown2026.05 | 80.87 | — | — | — | |
| Aegis Guard DefensiveModel Size=7B2026.05 | 78.5 | — | — | — | |
| o1-previewModel Size=Unknown2026.05 | 76.31 | — | — | — | |
| Aegis Guard PermissiveModel Size=7B2026.05 | 71.5 | — | — | — | |
| LLaMA Guard 2Model Size=8B2026.05 | 70.9 | — | — | — | |
| LLaMA Guard 3Model Size=8B2026.05 | 68.47 | — | — | — | |
| QwQ-previewModel Size=32B2026.05 | 66.02 | — | — | — | |
| ShieldGemmaModel Size=9B2026.05 | 57.74 | — | — | — | |
| LLaMA GuardModel Size=7B2026.05 | 56 | — | — | — | |
| ShieldGemmaModel Size=2B2026.05 | 9.36 | — | — | — | |
| Aegis-Guard-Dtype=Defensive2024.06 | — | 74.5 | 82 | 78.5 | |
| Aegis-Guard-Ptype=Permissive2024.06 | — | 62.9 | 77.9 | 71.5 | |
| DistilRoBERTa-based NBFModel Size=87M2025.02 | — | — | — | 61.7 | |
| GPT-42024.06 | — | 81.6 | 93.4 | 87.9 | |
| LLaMA GuardModel Size=7B2025.02 | — | — | — | 56 | |
| Llama-Guard2024.06 | — | 32.6 | 70.5 | 56 | |
| Llama-Guard22024.06 | — | 46.1 | 85.6 | 70.9 | |
| MPNet-based NBFModel Size=115M2025.02 | — | — | — | 57.2 | |
| OAI Mod. API2024.06 | — | 6.8 | 16.3 | 12.1 | |
| OpenAI ModerationModel Size=Unknown2025.02 | — | — | — | 12.1 | |
| ShieldGemmaModel Size=2B2025.02 | — | — | — | 9.4 | |
| WILDGUARD2024.06 | — | 85.5 | 91.7 | 88.9 |