Malicious Prompt Detection on Combined All Datasets (test)
4.5ASRToxicDetector
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| ToxicDetectorParams=300M + 7B, Fine-tunable=Yes, Backbone=LLama2-7B, Classifier=300M parameter MLP2026.02 | 4.5 | 32.6 | 84.7 | |
| BAGELParams=86M per finetune, 430M for n=5, Fine-tunable=Yes, k=9, n=52026.02 | 9.5 | 6.6 | 92.2 | |
| Perspective APIParams=Not Known, Fine-tunable=No2026.02 | 56.9 | 6.8 | 64.2 | |
| LastLayerParams=Not Applicable, Fine-tunable=No2026.02 | 59.8 | 17.1 | 51.9 | |
| ShieldGemmaParams=2B, Fine-tunable=Yes, Backbone=Gemma 2 LLM2026.02 | 62.4 | 3.8 | 53.4 | |
| OpenAIModeration APIParams=Not Known, Fine-tunable=No2026.02 | 88.1 | 2.4 | 20.8 |