Reinforcement Learning
Benchmarks
Dataset NameSOTA methodMetricTrendResultsLast Updated
7,010.88Average Reward
16
Jul 9, 2026
-164.82Average Return
16
Feb 26, 2026
354,122Return
16
May 19, 2026
142Average Returns
16
May 27, 2026
22HWRB
16
Feb 26, 2026
725Cartpole Swingup Return
15
Jul 2, 2026
7,586Average Reward
15
Jun 16, 2026
2,743.9Avg Episode Reward
15
Feb 26, 2026
283.56Average Episode Reward
15
May 11, 2026
2,041.12Median Human Norm Return
15
Feb 26, 2026
1,006.4Median Human-Normalized Score
15
Feb 26, 2026
7,127.7Alien Score
15
Feb 26, 2026
359.79Mean Reward
15
Feb 26, 2026
499.11Average Episode Reward
14
Jul 9, 2026
200Maximum Return
14
May 12, 2026
289Average Agent Reward
14
Mar 13, 2026
10,554Max Return
14
Jun 24, 2026
54.7Normalized Score
14
Mar 10, 2026
6,115Average Return
14
Feb 26, 2026
34Score
14
Feb 26, 2026
1.02Avg AUC (z-scored)
13
Jun 16, 2026
1.06Avg AUC (z-scored)
13
Jun 16, 2026
1.71Average AUC (z-scored)
13
Jun 16, 2026
1.56Average AUC (z-scored)
13
Jun 16, 2026
2.24Average AUC (z-scored)
13
Jun 16, 2026