Reinforcement Learning
Benchmarks
Dataset NameSOTA methodMetricTrendResultsLast Updated
4,314.7ALIEN Score
3
May 18, 2026
166.3Return
3
May 7, 2026
27.7True Return
3
Apr 30, 2026
6.28True Score
3
Apr 15, 2026
0.999Return
3
Apr 7, 2026
0.03Execution Time
3
Mar 23, 2026
3,290,150Clean Reward
3
Feb 26, 2026
3,680,220Clean Reward
3
Feb 26, 2026
4,720,255Clean Reward
3
Feb 26, 2026
0.93Clean Reward
3
Feb 26, 2026
93Clean Reward
3
Feb 26, 2026
2,262.56Mean Return
3
Feb 26, 2026
1,579.64Mean Score
3
Feb 26, 2026
9.72Mean Score
3
Feb 26, 2026
9.78Mean Score
3
Feb 26, 2026
556.4Online Normalized Score (1M steps)
3
Feb 26, 2026
89Online Score (1M Steps)
3
Feb 26, 2026
96.2Online Score (1M steps)
3
Feb 26, 2026
1,000Average Decisions
3
Feb 26, 2026
960.57Average Decisions
3
Feb 26, 2026
988.17Avg Decisions
3
Feb 26, 2026
998.99Average Decisions
3
Feb 26, 2026
1,000Decisions
3
Feb 26, 2026
10.6Average Decisions
3
Feb 26, 2026
1,263Mean Score
3
Feb 26, 2026