Reinforcement Learning
Benchmarks
Dataset NameSOTA methodMetricTrendResultsLast Updated
282Final Mean Score
3
Feb 26, 2026
11,931Mean Score
3
Feb 26, 2026
303Final Mean Score
3
Feb 26, 2026
585,000Total Steps
3
Feb 26, 2026
400,000Episode Count
3
Feb 26, 2026
400,000Environment Episodes
3
Feb 26, 2026
2,000,000Episodes Completed
3
Feb 26, 2026
2,000,000Episodes Run
3
Feb 26, 2026
2,000,000Total Episodes
3
Feb 26, 2026
2,000,000Episodes
3
Feb 26, 2026
2,000,000Total Episodes
3
Feb 26, 2026
62,591,150Score
3
Feb 26, 2026
311Median Human-Normalized Score
3
Feb 26, 2026
12,301.1Asterix Score
3
Feb 26, 2026
0.61Mean Normalized Score
3
Feb 26, 2026
2,041.1Median Human-Normalized Score
3
Feb 26, 2026
0.913P(Goal)
3
Feb 26, 2026
4.4Freeway Score
3
Feb 26, 2026
4,600Score
3
Feb 26, 2026
6,742Score
3
Feb 26, 2026
-10Score
3
Feb 26, 2026
3,590Score
3
Feb 26, 2026
138.7Median Human-Normalized Score
3
Feb 26, 2026
15,000Best Stable Score
3
Feb 26, 2026
4.84Cumulative Reward
2
Jun 16, 2026