Reinforcement Learning
Benchmarks
Dataset NameSOTA methodMetricTrendResultsLast Updated
1Reward
5
Jun 16, 2026
93Reward
5
Jun 16, 2026
98Reward
5
Jun 16, 2026
995CartPole Balance
5
Jun 16, 2026
99.1Normalized Score
5
Jun 16, 2026
98.5Normalized Score
5
Jun 16, 2026
242.2Avg Reward (AT-DPT Attacker)
5
Jun 9, 2026
20Environment Steps (M)
5
Jun 8, 2026
12.8Success Rate
5
May 29, 2026
7.4Success Rate (SR)
5
May 29, 2026
50Success Rate
5
May 29, 2026
27.2Success Rate (SR)
5
May 29, 2026
80Success Rate (SR)
5
May 29, 2026
86.7Success Rate
5
May 29, 2026
24.3Success Rate
5
May 29, 2026
100Success Rate (SR)
5
May 29, 2026
99.9Success Rate (SR)
5
May 29, 2026
88.8Success Rate
5
May 29, 2026
542.38Average Final Reward
5
May 26, 2026
61.81Scaled Mean Cumulative Reward
5
May 21, 2026
78.78Scaled Mean Reward
5
May 21, 2026
205,000Steps to 75% Return
5
May 18, 2026
245.2Steps to 75% Return (k)
5
May 18, 2026
145,400Environment Steps to 75% Return (k)
5
May 18, 2026
383,100Environment Steps to 75% Return
5
May 18, 2026