Safe Reinforcement Learning
Benchmarks
Dataset NameSOTA methodMetricTrendResultsLast Updated
100ACS
4
Apr 27, 2026
100ACS (%)
4
Apr 27, 2026
9.01Return
4
Mar 26, 2026
4.77Return
4
Mar 26, 2026
24.26Return
4
Mar 26, 2026
5,948Return
4
Mar 26, 2026
3,057Return
4
Mar 26, 2026
2,619Return
4
Mar 26, 2026
36.32Average Reward
4
Feb 26, 2026
270.45Reward
3
Jul 7, 2026
243.63Reward
3
Jul 7, 2026
253.58Reward
3
Jul 7, 2026
257.98Reward
3
Jul 7, 2026
237.75Reward
3
Jul 7, 2026
236.57Reward
3
Jul 7, 2026
242.75Reward
3
Jul 7, 2026
316.47Reward
3
Jul 7, 2026
330.39Reward
3
Jul 7, 2026
0Reward Hacking Rate
3
Apr 1, 2026
0.2Mean Safety Violations per Episode
3
Feb 26, 2026
3Mean Safety Violations per Episode
3
Feb 26, 2026
0.1Safety Violations / Episode (Mean)
3
Feb 26, 2026
0.8Mean Safety Violations per Episode
3
Feb 26, 2026
0Mean Safety Violations per Episode
3
Feb 26, 2026
0.3Mean Safety Violations per Episode
3
Feb 26, 2026