Reinforcement Learning
Benchmarks
Dataset NameSOTA methodMetricTrendResultsLast Updated
3,907Return
7
Feb 26, 2026
1,676Return
7
Feb 26, 2026
685Return
7
Feb 26, 2026
2Runtime (hours)
7
Feb 26, 2026
0.142Average Update Time (s)
7
Feb 26, 2026
0.121Average Update Time (s)
7
Feb 26, 2026
518.2Mean Human Normalized Score
7
Feb 26, 2026
1,426Mean Human-Normalized Score
7
Feb 26, 2026
188,200Mean Return
7
Feb 26, 2026
5,818Final Return
7
Feb 26, 2026
8,048Return
7
Feb 26, 2026
3,405Final Return
7
Feb 26, 2026
10,563Final Return
7
Feb 26, 2026
5,909Final Return
7
Feb 26, 2026
11,200Score
7
Feb 26, 2026
1,400Best Stable Score
7
Feb 26, 2026
41.3Mean Episodic Reward
6
Jul 7, 2026
25.77Mean Episodic Reward
6
Jul 7, 2026
19.45Mean Episodic Reward
6
Jul 7, 2026
101.42Mean Episodic Reward
6
Jul 7, 2026
27.58Mean Episodic Reward
6
Jul 7, 2026
83Average Win Rate
6
Jun 23, 2026
83Average Win Rate
6
Jun 23, 2026
83Average Win Rate
6
Jun 23, 2026
83Average Win Rate
6
Jun 23, 2026