ResearchTasksSafety AssessmentFollowBenchmarksDataset NameSOTA MethodSortMost resultsRecently updatedMost papersApplyDataset NameSOTA methodMetricTrendResultsLast UpdatedSafety Avg.JailJudge2.691MAE14Apr 21, 2026StrongRejectIdentity-Robust Generation0.179Personalization Bias (PB)9Feb 26, 2026Safety Prompts (randomly selected 200 samples per field)llama2 -> CP -> FT + 0.5 chat vector1.5Insensitivity Score9Feb 26, 2026Qualitative Assessment DatasetMi:dm 2.0-Base97.7Not Unsafe Rate (Content Safety)4Mar 23, 2026
Safety Prompts (randomly selected 200 samples per field)llama2 -> CP -> FT + 0.5 chat vector1.5Insensitivity Score9Feb 26, 2026