Reinforcement Learning
Benchmarks
Dataset NameSOTA methodMetricTrendResultsLast Updated
278,800Steps to 75% Return
6
May 18, 2026
203,100Steps to 75% Return
6
May 18, 2026
475,000Steps to 75% Return
6
May 18, 2026
5.1Return
6
May 12, 2026
5.65Return
6
May 12, 2026
452Return
6
May 12, 2026
0.37Return
6
May 12, 2026
2Regret
6
May 11, 2026
709,280Training Steps (Mean)
6
May 8, 2026
127,680Episode Steps (Mean)
6
May 8, 2026
80,240Steps (Mean)
6
May 8, 2026
3,312Return
6
May 7, 2026
4,329Return
6
May 7, 2026
5,498Return
6
May 7, 2026
4,260Return
6
May 7, 2026
5,492Average Episodic Return
6
Apr 21, 2026
3,275Hopper Score
6
Apr 14, 2026
668.48Game Score
6
Apr 3, 2026
98.57Accuracy (%)
6
Mar 24, 2026
57.64Accuracy
6
Mar 24, 2026
62.75Accuracy
6
Mar 24, 2026
84.13Accuracy
6
Mar 24, 2026
0.97IQM
6
Mar 20, 2026
0.85IQM
6
Mar 20, 2026
6Episode Return
6
Mar 20, 2026