Reinforcement Learning
Benchmarks
Dataset NameSOTA methodMetricTrendResultsLast Updated
4,888Average Performance
12
Feb 26, 2026
1,946Average Reward
12
Feb 26, 2026
8,174Avg Performance
12
Feb 26, 2026
10,249Average Return
12
Mar 12, 2026
4,770Average Score
12
Apr 6, 2026
150,700Steps to 75% Return
11
May 18, 2026
71.34Freeway Score
11
May 21, 2026
1Dynamic Regret
11
Apr 21, 2026
5,906.7Performance Score
11
Feb 26, 2026
5,244Avg Return (Ant-v4)
11
Mar 17, 2026
1,120Sample Complexity
11
Feb 26, 2026
1,560Sample Complexity (Regret < 0.4)
11
Feb 26, 2026
57Games Above Human Count
11
Feb 26, 2026
54,500Mean Episode Return
11
Feb 26, 2026
3,459Montezuma's Revenge Score
11
Feb 26, 2026
-38.6Average Episode Return
10
May 29, 2026
98.33Normalized Return
10
Jun 9, 2026
79.46Net Feeding Requests
10
Apr 3, 2026
1Sample Complexity
10
Mar 31, 2026
4,909Average Return
10
Mar 12, 2026
131,842Reward
10
Mar 9, 2026
4,759Reward
10
Mar 9, 2026
32.73Expected Value (E)
10
Feb 26, 2026
4,665Total Reward
10
Feb 26, 2026
-3.57Return
10
Feb 26, 2026