Harmful prompt detection on TChat
76.51F1 ScoreMLPM
Evaluation Results
| Method | Links | |
|---|---|---|
| MLPMBackbone=OLMo2-7B-Inst, Methodology=Latent-Based2025.02 | 76.51 | |
| Aegis-Guard-DMethodology=Guard Model2025.02 | 75.61 | |
| GraniteGuardian-3-1-8BMethodology=Guard Model2025.02 | 73.25 | |
| Abdelnabi et al.Backbone=OLMo2-7B-Inst, Methodology=Latent-Based2025.02 | 72.53 | |
| WildGuardMethodology=Guard Model2025.02 | 70.14 | |
| MLPMBackbone=Llama-8B-Inst, Methodology=Latent-Based2025.02 | 69.17 | |
| Ayub & MajumdarBackbone=Qwen3-8B-Inst, Methodology=Latent-Based2025.02 | 68.9 | |
| ShieldGemma-9BMethodology=Guard Model2025.02 | 68.13 | |
| MLPMBackbone=Mistral-7B-Inst, Methodology=Latent-Based2025.02 | 66.33 | |
| Ayub & MajumdarBackbone=OLMo2-7B-Inst, Methodology=Latent-Based2025.02 | 65.63 | |
| MLPMBackbone=Qwen3-8B-Inst, Methodology=Latent-Based2025.02 | 64.4 | |
| Ayub & MajumdarBackbone=Mistral-7B-Inst, Methodology=Latent-Based2025.02 | 63.44 | |
| Abdelnabi et al.Backbone=Qwen3-8B-Inst, Methodology=Latent-Based2025.02 | 60.94 | |
| Abdelnabi et al.Backbone=Llama-8B-Inst, Methodology=Latent-Based2025.02 | 59.59 | |
| Abdelnabi et al.Backbone=Mistral-7B-Inst, Methodology=Latent-Based2025.02 | 57.63 | |
| Ayub & MajumdarBackbone=Llama-8B-Inst, Methodology=Latent-Based2025.02 | 55.62 | |
| LlamaGuard3Methodology=Guard Model2025.02 | 54.11 |