Reinforcement Learning
Benchmarks
Dataset NameSOTA methodMetricTrendResultsLast Updated
0.65Reward
6
Feb 26, 2026
0.98Reward
6
Feb 26, 2026
0.59Reward
6
Feb 26, 2026
1Reward
6
Feb 26, 2026
0.79Reward
6
Feb 26, 2026
0.97Reward
6
Feb 26, 2026
0.7Reward
6
Feb 26, 2026
0.63Reward
6
Feb 26, 2026
273.2Return
6
Mar 12, 2026
25,222Steps to 100% Success
6
Feb 26, 2026
16,240Training Steps
6
Feb 26, 2026
7,312Training Steps
6
Feb 26, 2026
437Cartpole Swingup Score
6
Feb 26, 2026
2,009.88Mean Score
6
Feb 26, 2026
1.61Mean Return
6
Feb 26, 2026
-57Episode Return
6
Feb 26, 2026
24Mean Score
6
Feb 26, 2026
22.7Mean Performance
6
Feb 26, 2026
85.1Mean Performance
6
Feb 26, 2026
34.1Mean Score
6
Feb 26, 2026
32.9Mean Performance Score
6
Feb 26, 2026
1,000Average Decisions
6
Feb 26, 2026
96.9Success Rate (umaze-v0)
6
Feb 26, 2026
97.6Hopper v2 MR Score
6
Feb 26, 2026
35Overall Score
6
Feb 26, 2026