Reinforcement Learning
Benchmarks
Dataset NameSOTA methodMetricTrendResultsLast Updated
3,684Natural Return
5
Feb 26, 2026
395Average Return
5
Feb 26, 2026
20.24Final Return
5
Feb 26, 2026
85Success Rate
5
Feb 26, 2026
452.1Acrobot Swingup Score
5
Feb 26, 2026
7,127.7Alien Score
5
Feb 26, 2026
61.59Final Return
5
Feb 26, 2026
1.93Normalized Mean
5
Feb 26, 2026
98.3Steps to Goal
5
Feb 26, 2026
13Mean Score
5
Feb 26, 2026
13.1Mean Score
5
Feb 26, 2026
7.4Mean Score
5
Feb 26, 2026
13Mean Reward
5
Feb 26, 2026
12.7Mean Score
5
Feb 26, 2026
13.2Mean Score
5
Feb 26, 2026
-0.63Episode Return
5
Feb 26, 2026
-0.23Episode Return
5
Feb 26, 2026
18.6Episode Return
5
Feb 26, 2026
77Normalized Performance
5
May 29, 2026
549Policy Return
5
May 29, 2026
2,287Return
5
May 29, 2026
6.62Avg External Reward per Episode
5
Feb 26, 2026
9.76Avg Cumulative Reward
5
Feb 26, 2026
9.4Avg Cumulative Reward
5
Feb 26, 2026
11.14Avg Cumulative Reward
5
Feb 26, 2026