Unsupervised Reinforcement Learning
Benchmarks
Dataset NameSOTA methodMetricTrendResultsLast Updated
9Reach Bottom Left
12
Feb 26, 2026
627Jump Score
12
Feb 26, 2026
237Flip Score
12
Feb 26, 2026
23Average Return
6
Feb 26, 2026
645Average Return
6
Feb 26, 2026
378Average Return
6
Feb 26, 2026
619Average Return
6
Feb 26, 2026
11.22Entropy H(Mπ_S)
2
Feb 26, 2026
14.43Entropy (State)
2
Feb 26, 2026
13.63Entropy H(Mπ_S)
2
Feb 26, 2026
13.97Entropy (State-Dependent Policy)
2
Feb 26, 2026