Reinforcement Learning
Benchmarks
Dataset NameSOTA methodMetricTrendResultsLast Updated
9.8Return
4
May 12, 2026
9,721Reward
4
May 12, 2026
93Mean Best Reward
4
May 12, 2026
294.57Mean Best Reward
4
May 12, 2026
3Mean Best Reward
4
May 12, 2026
1Mean Best Reward
4
May 12, 2026
0.61Mean Reward
4
May 12, 2026
-58.557Reward
4
May 8, 2026
5,350.9Mean Return
4
May 1, 2026
5,608.2Mean Episode Return
4
May 1, 2026
71.8D4RL Score
4
Apr 16, 2026
2,080Training Episodes Required
4
Mar 13, 2026
890Episodes to Threshold 2500
4
Mar 13, 2026
472.3Avg Episodic Reward
4
Mar 12, 2026
496.4Average Episodic Reward
4
Mar 12, 2026
10,550.9Average Episodic Reward
4
Mar 12, 2026
21,857.9Average Episodic Reward
4
Mar 12, 2026
-150,000Average Episodic Reward
4
Mar 12, 2026
161,184.5Average Episodic Reward
4
Mar 12, 2026
5,020Average Episodic Reward
4
Mar 12, 2026
760.1Average Episodic Reward
4
Mar 12, 2026
-4Avg Episodic Reward
4
Mar 12, 2026
9,167.5Average Episodic Reward
4
Mar 12, 2026
1,000Average Episodic Reward
4
Mar 12, 2026
1,365.6Runtime (s)
4
Mar 12, 2026