Safe Reinforcement Learning
Benchmarks
Dataset NameSOTA methodMetricTrendResultsLast Updated
64.1JR
11
Jun 11, 2026
64.3JR
10
Jun 11, 2026
0.69Normalized Reward
10
Feb 26, 2026
0.73Normalized Reward
10
Feb 26, 2026
29Utility Score
10
Feb 26, 2026
577.7Reward
8
Jul 1, 2026
684.8Reward
8
Jul 1, 2026
86.71TIR (%)
8
Feb 26, 2026
324.41Reward
7
Jul 7, 2026
8.64Final Reward
7
Jun 23, 2026
35Final Success Rate
7
Jun 23, 2026
88Final Success Rate
7
Jun 23, 2026
1,554.56Reward
7
Feb 26, 2026
100Verified-15 Count
7
Feb 26, 2026
100Verified Count (50)
7
Feb 26, 2026
100Verified Rate (80)
7
Feb 26, 2026
239.4Training Time (s)
7
Feb 26, 2026
81.4Training Time (s)
7
Feb 26, 2026
68.7Training Time (s)
7
Feb 26, 2026
18.3Final Reward
6
Jun 23, 2026
19.6Final Reward
6
Jun 23, 2026
42Final SR
6
Jun 23, 2026
77.5Time-To-Safety (TTS)
6
Jun 15, 2026
2.333TTS (Time To Safety)
6
Jun 15, 2026
3.206Time To Safety (TTS)
6
Jun 15, 2026