Reinforcement Learning
Benchmarks
Dataset NameSOTA methodMetricTrendResultsLast Updated
1,673.58Average Return
3
Jun 16, 2026
926.51Average Return
3
Jun 16, 2026
5.07Cumulative Reward
3
Jun 16, 2026
4.43Cumulative Reward
3
Jun 16, 2026
9.35Cumulative Reward
3
Jun 16, 2026
6.84Cumulative Reward
3
Jun 16, 2026
4.29Cumulative Reward
3
Jun 16, 2026
6.11Cumulative Reward
3
Jun 16, 2026
4Environment Steps (M)
3
Jun 8, 2026
6,849Mean Reward
3
Jun 5, 2026
5,007Mean Reward
3
Jun 5, 2026
5,867Mean Reward
3
Jun 5, 2026
6,620Mean Reward
3
Jun 5, 2026
3,810Mean Reward
3
Jun 5, 2026
366Mean Reward
3
Jun 5, 2026
96,720Episodes
3
Jun 5, 2026
73,500Number of Episodes
3
Jun 5, 2026
14,250Episode Count
3
Jun 5, 2026
11,250Number of Episodes
3
Jun 5, 2026
13,920Episode Count
3
Jun 5, 2026
88.1Normalized Score
3
May 28, 2026
55Normalized Score
3
May 28, 2026
91.2Normalized Score
3
May 28, 2026
7.09Return (%)
3
May 19, 2026
565Mean Evaluation Return
3
May 18, 2026