Safety Evaluation
Benchmarks
Dataset NameSOTA methodMetricTrendResultsLast Updated
100Good Bot Rate
3
Mar 10, 2026
0Unsafe Interaction Rate
3
Mar 10, 2026
84.57LlavaGuard Performance
3
Mar 4, 2026
87F1 Score
3
Feb 26, 2026
72F1
3
Feb 26, 2026
73F1 Score
3
Feb 26, 2026
78F1 Score
3
Feb 26, 2026
96Safety Score
3
Feb 26, 2026
23HPR
3
Feb 26, 2026
0.012Harmful Rate
3
Feb 26, 2026
1.66Harmful Content Rate
3
Feb 26, 2026
99.5Not Overrefuse Rate
3
Feb 26, 2026
0Illegal Content Count
3
Feb 26, 2026
27.6Over
2
Jun 9, 2026
8.9Harmful Score (N=1000)
2
May 26, 2026
2.4Harmfulness Score
2
Mar 4, 2026
60Win Rate
2
Feb 26, 2026
0NFP
1
May 4, 2026
0NFP
1
May 4, 2026
10NFP
1
May 4, 2026
0NFP
1
May 4, 2026
0NFP Rate
1
May 4, 2026
—
—Primary metric
0
Feb 26, 2026
—
—Primary metric
0
Feb 26, 2026