Reinforcement Learning
Benchmarks
Dataset NameSOTA methodMetricTrendResultsLast Updated
5,866Average Return
8
Feb 26, 2026
6,360Average Return
8
Feb 26, 2026
2,846Average Return
8
Feb 26, 2026
8,705Average Return
8
Feb 26, 2026
5,949Average Return
8
Feb 26, 2026
266.26Return
8
Feb 26, 2026
267.19Return
8
Feb 26, 2026
-133.42Return
8
Feb 26, 2026
2,279.4Average Score
8
Feb 26, 2026
100Reward
7
Jun 23, 2026
31.33Mean Score
7
May 21, 2026
1,010.04Reward
7
May 19, 2026
413.12Reward
7
May 19, 2026
102.65Reward
7
May 19, 2026
4,790.1Cumulative Reward
7
May 19, 2026
0.97Reward
7
May 19, 2026
199.99Cumulative Reward
7
May 19, 2026
96.71Normalized Return
7
May 15, 2026
983Average Episodic Return
7
Apr 21, 2026
3,683Average Episodic Return
7
Apr 21, 2026
149,000Episodic Return
7
Mar 16, 2026
6,367Return
7
Mar 16, 2026
3,871Return
7
Mar 16, 2026
2,737Return
7
Mar 16, 2026
-669.16Reward
7
Feb 26, 2026