Harmful prompt detection
Benchmarks
Dataset NameSOTA methodMetricTrendResultsLast Updated
81.3F1 Score
29
Jul 8, 2026
100F1 Score
27
Jul 3, 2026
100F1 Score
27
Jul 3, 2026
97.44F1 Score
20
Jun 2, 2026
90.18F1 Score (Combined Average)
17
Jun 2, 2026
97.55F1 Score
17
Jun 2, 2026
88.52F1 Score
17
Jun 2, 2026
76.51F1 Score
17
Jun 2, 2026
98Precision
11
Apr 9, 2026
100Precision
6
Apr 9, 2026
100Precision
6
Apr 9, 2026
99Accuracy
6
Apr 9, 2026
66Accuracy
6
Apr 9, 2026
99Accuracy
6
Apr 9, 2026
100Precision
6
Apr 9, 2026
98Precision
6
Apr 9, 2026
0.964AUROC (Harmful/Normal)
6
Mar 31, 2026
97Precision
5
Apr 9, 2026
99Precision
5
Apr 9, 2026
96Precision
5
Apr 9, 2026