ResearchDatasetsAdvBench & XSTestFollowBenchmarksTask NameDataset NameSOTA MethodSortMost resultsRecently updatedMost papersApplyTask NameDataset NameSOTA ResultTrendResultsHarmful prompt detectionAdvBench & XSTest (held-out evaluation sets)0.964AUROC (Harmful/Normal)6