Safe Reinforcement Learning
Benchmarks
Dataset NameSOTA methodMetricTrendResultsLast Updated
0Mean Safety Violations per Episode
3
Feb 26, 2026
0.8Mean Safety Violations / Episode
3
Feb 26, 2026
0Shield Invocations / Episode (Mean)
3
Feb 26, 2026
0Mean Shield Invocations per Episode
3
Feb 26, 2026
0Mean Shield Invocations per Episode
3
Feb 26, 2026
0Mean Shield Invocations / Episode
3
Feb 26, 2026
0Mean Shield Invocations per Episode
3
Feb 26, 2026
750.1Final Reward
2
Jun 23, 2026
41Categorical Success Rate
2
Jun 11, 2026
30Categorical Violation Rate (%)
2
Jun 11, 2026
7.5Success Rate (%)
2
Jun 11, 2026
2Categorical Violation Rate (%)
2
Jun 11, 2026
3Regret
2
Mar 31, 2026
2Regret
2
Mar 31, 2026
750.1Final Reward
1
Jun 23, 2026
—
—Primary metric
0
Apr 2, 2026
—
—Primary metric
0
Feb 26, 2026
—
—Primary metric
0
Feb 26, 2026
—
—Primary metric
0
Feb 26, 2026
—
—Primary metric
0
Feb 26, 2026
—
—Primary metric
0
Feb 26, 2026
—
—Primary metric
0
Feb 26, 2026
—
—Primary metric
0
Feb 26, 2026
—
—Primary metric
0
Feb 26, 2026
—
—Primary metric
0
Feb 26, 2026