Reinforcement Learning
Benchmarks
Dataset NameSOTA methodMetricTrendResultsLast Updated
5.15Cumulative Reward
2
Jun 16, 2026
5.65Cumulative Reward
2
Jun 16, 2026
3.57Cumulative Reward
2
Jun 16, 2026
418.7Improvement over BC
2
Jun 9, 2026
84.5Improvement over BC
2
Jun 9, 2026
53.2Improvement over BC
2
Jun 9, 2026
17Environment Steps (M)
2
Jun 8, 2026
1,550Number of Episodes
2
Jun 5, 2026
625Reward
2
May 12, 2026
6,822Reward
2
May 12, 2026
105Median Score (% PPO)
2
May 8, 2026
750Episodes to Target Reward
2
Apr 28, 2026
208.2Terminal Performance
2
Apr 3, 2026
632Terminal Performance
2
Apr 3, 2026
270.9Terminal Performance
2
Apr 3, 2026
22.3Terminal Performance
2
Apr 3, 2026
640.01Average Agent Reward
2
Feb 26, 2026
0.95Mean Reward
2
Feb 27, 2026
96Mean Reward
2
Feb 27, 2026
-159,622,041.44AUC@T
2
Feb 27, 2026
-126,442,915.13AUC@T
2
Feb 27, 2026
-260,948,236.73AUC@T
2
Feb 27, 2026
-30,641,411.5AUC@T
2
Feb 27, 2026
-26,282,013.77AUC@T
2
Feb 27, 2026
-28,087,189.02AUC@T
2
Feb 27, 2026