Reinforcement Learning
Benchmarks
Dataset NameSOTA methodMetricTrendResultsLast Updated
20Average Total Reward
5
Feb 26, 2026
470Average Total Reward
5
Feb 26, 2026
168Average Total Reward
5
Feb 26, 2026
7,456Average Episode Reward
5
Feb 26, 2026
11,820,726Training Steps
4
Jul 3, 2026
5,381.07Mean Reward
4
Jun 26, 2026
6.6Arrival Time (T=200)
4
Jun 19, 2026
308.03Mean Score
4
Jun 19, 2026
0.834Normalized Score
4
Jun 16, 2026
89.4BigFish Score
4
Jun 11, 2026
314.03Average Performance
4
Jun 5, 2026
1,955.47Average Performance Score
4
Jun 5, 2026
2,016.5Average Performance Value
4
Jun 5, 2026
5,375Final Performance
4
May 25, 2026
5,042.9Final Return
4
May 25, 2026
809.6Final Performance
4
May 25, 2026
9,347.1Final Score
4
May 25, 2026
190.2Final Performance Score
4
May 25, 2026
996.7Final Return
4
May 25, 2026
20,679Mean Evaluation Return
4
May 18, 2026
374Mean Return
4
May 18, 2026
18,598Mean Return
4
May 18, 2026
345,000Steps to 75% Return
4
May 18, 2026
508Return
4
May 12, 2026
188Return
4
May 12, 2026