Harmful prompt detection on Combined Average
90.18F1 Score (Combined Average)MLPM
Evaluation Results
| Method | Links | |
|---|---|---|
| MLPMBackbone=OLMo2-7B-Inst, Methodology=Latent-Based2025.02 | 90.18 | |
| WildGuardMethodology=Guard Model2025.02 | 88.93 | |
| MLPMBackbone=Llama-8B-Inst, Methodology=Latent-Based2025.02 | 88.3 | |
| MLPMBackbone=Mistral-7B-Inst, Methodology=Latent-Based2025.02 | 87.55 | |
| Abdelnabi et al.Backbone=OLMo2-7B-Inst, Methodology=Latent-Based2025.02 | 87.35 | |
| Ayub & MajumdarBackbone=OLMo2-7B-Inst, Methodology=Latent-Based2025.02 | 87.06 | |
| MLPMBackbone=Qwen3-8B-Inst, Methodology=Latent-Based2025.02 | 85.95 | |
| GraniteGuardian-3-1-8BMethodology=Guard Model2025.02 | 85.62 | |
| Abdelnabi et al.Backbone=Llama-8B-Inst, Methodology=Latent-Based2025.02 | 84.51 | |
| Abdelnabi et al.Backbone=Qwen3-8B-Inst, Methodology=Latent-Based2025.02 | 84.36 | |
| Abdelnabi et al.Backbone=Mistral-7B-Inst, Methodology=Latent-Based2025.02 | 84.32 | |
| Ayub & MajumdarBackbone=Mistral-7B-Inst, Methodology=Latent-Based2025.02 | 84.31 | |
| Ayub & MajumdarBackbone=Qwen3-8B-Inst, Methodology=Latent-Based2025.02 | 82.69 | |
| Ayub & MajumdarBackbone=Llama-8B-Inst, Methodology=Latent-Based2025.02 | 82.09 | |
| LlamaGuard3Methodology=Guard Model2025.02 | 79.56 | |
| Aegis-Guard-DMethodology=Guard Model2025.02 | 78.82 | |
| ShieldGemma-9BMethodology=Guard Model2025.02 | 73.1 |