Reinforcement Learning
Benchmarks
Dataset NameSOTA methodMetricTrendResultsLast Updated
90.4Score
5
May 15, 2026
93Score
5
May 15, 2026
98.8Success Rate
5
May 15, 2026
97.4Score
5
May 15, 2026
99.2Score
5
May 15, 2026
99.4Score
5
May 15, 2026
98.9Score (umaze-default)
5
May 14, 2026
500Mean Best Reward
5
May 12, 2026
0.93Mean Best Reward
5
May 12, 2026
1,000Mean Best Reward
5
May 12, 2026
3,609.37Mean Best Reward
5
May 12, 2026
294.57Mean Best Reward
5
May 12, 2026
3Mean Best Reward
5
May 12, 2026
1Mean Best Reward
5
May 12, 2026
15.54Average Reward
5
May 11, 2026
158.5Score (mass×0.7)
5
May 8, 2026
242.8Score (Friction 0.5)
5
May 8, 2026
11,708.1TFLOPs
5
May 8, 2026
77.94Normalized Score
5
May 8, 2026
99.1Mean Normalized Return
5
May 7, 2026
81.8Mean Normalized Return
5
May 7, 2026
83.4Mean Normalized Return
5
May 7, 2026
100Mean Normalized Return
5
May 7, 2026
92.9Mean Normalized Return
5
May 7, 2026
96.3Mean Normalized Return
5
May 7, 2026