Reinforcement Learning
Benchmarks
Dataset NameSOTA methodMetricTrendResultsLast Updated
423.4Runtime (seconds)
4
Mar 12, 2026
84,665Reward
4
Mar 9, 2026
-11.69IQM Returns
4
Feb 26, 2026
2,896.43IQM Return
4
Feb 26, 2026
1,227.18Average Return
4
Feb 26, 2026
3,220.12Avg Return
4
Feb 26, 2026
2,276.53Avg Return
4
Feb 26, 2026
4,593.96Average Return
4
Feb 26, 2026
20.01BigFish Score
4
Feb 26, 2026
850Model Parameters
4
Feb 26, 2026
279Return (Noisy)
4
Feb 26, 2026
354,122Clean Return
4
Feb 26, 2026
1,520.18Avg Reward
4
Feb 26, 2026
36.32Average Reward
4
Feb 26, 2026
1,937.61Mean Return
4
Feb 26, 2026
-3,723.03Mean Return
4
Feb 26, 2026
-39.79Mean Completion Time
4
Feb 26, 2026
9.25Mean Score
4
Feb 26, 2026
340Normalized Return
4
Feb 26, 2026
53.4Normalized Return
4
Feb 26, 2026
58.9Normalized Return
4
Feb 26, 2026
45.3Normalized Return
4
Feb 26, 2026
93.2Normalized Return
4
Feb 26, 2026
97Normalized Return
4
Feb 26, 2026
84.1Normalized Return
4
Feb 26, 2026