Reinforcement Learning
Benchmarks
Dataset NameSOTA methodMetricTrendResultsLast Updated
11.61Avg Cumulative Reward
5
Feb 26, 2026
0Avg Cumulative External Reward
5
Feb 26, 2026
6.44Avg Cumulative External Reward per Episode
5
Feb 26, 2026
11.36Avg Cumulative External Reward
5
Feb 26, 2026
10.05Avg Cumulative External Reward
5
Feb 26, 2026
12,460Average Maximal Score
5
Feb 26, 2026
0Average Maximal Score
5
Feb 26, 2026
2,188Average Maximal Score
5
Feb 26, 2026
3Time Cost
5
Feb 26, 2026
33Sample Complexity
5
Feb 26, 2026
61Sample Complexity
5
Feb 26, 2026
21Sample Complexity (Regret < 0.4)
5
Feb 26, 2026
1,093.9Mean Final Score
5
Feb 26, 2026
27,234.1Mean Final Score
5
Feb 26, 2026
288.8Mean Final Score
5
Feb 26, 2026
12.1Score
5
Feb 26, 2026
435.56PPO Normalized Score (Mean)
5
Feb 26, 2026
435.56PPO-normalized Mean Score
5
Feb 26, 2026
311.41Average Reward
5
Feb 26, 2026
222.88Average Reward
5
Feb 26, 2026
333.65Average Reward
5
Feb 26, 2026
281.99Average Reward
5
Feb 26, 2026
296.34Average Reward
5
Feb 26, 2026
181.94Average Reward
5
Feb 26, 2026
352.1Average Reward
5
Feb 26, 2026