Malicious Prompt Detection on LLM-LAT/harmful-dataset
92.1AccuracyEnhanced Filtering and Summarization System
Evaluation Results
| Method | Links | |
|---|---|---|
| Enhanced Filtering and Summarization SystemNumber of Prompts=49482025.05 | 92.1 | |
| Logistic RegressionNumber of Prompts=49482025.05 | 12.31 | |
| Toxic-BERTNumber of Prompts=49482025.05 | 2.57 | |
| Hate Speech DetectorNumber of Prompts=49482025.05 | 0.81 |