Reinforcement Learning
Benchmarks
Dataset NameSOTA methodMetricTrendResultsLast Updated
3,732.5Average Return
101
Mar 13, 2026
98.75Average Agent Reward
65
May 12, 2026
533.6Mean Reward
65
May 11, 2026
6,633.8Average Return
57
Mar 13, 2026
1,399,753Avg Reward (baseline)
52
Feb 26, 2026
7,128Alien Score
50
Jul 7, 2026
200Mean Score
48
Apr 1, 2026
13,996.2Average Return
47
May 1, 2026
6,335.5Average Return
45
Apr 3, 2026
18,003,200Score
45
Feb 26, 2026
89.37Mean Return
42
May 19, 2026
1,035.52Average Returns
38
Feb 26, 2026
17,177Mean Reward
34
Apr 7, 2026
90,921,063Zero-Shot Reward
32
May 12, 2026
56.09Performance Score
30
May 19, 2026
128Average Total Reward per Episode
30
May 19, 2026
27,721,263Average Return
30
Jun 24, 2026
200Average Reward (2/0.5)
30
Feb 26, 2026
-44.6Avg Reward (gamma=0.01)
30
Feb 26, 2026
2,292Final Return
30
May 19, 2026
1,000Average Reward
29
May 12, 2026
13,907Average Return
28
Mar 12, 2026
1,000Mean Reward
27
Apr 7, 2026
5,527Average Return
26
Jun 26, 2026
4,104Average Final Return
26
Apr 7, 2026