Reinforcement Learning
Benchmarks
Dataset NameSOTA methodMetricTrendResultsLast Updated
290Episodes to Threshold (Score 200)
8
Mar 13, 2026
830Episodes to Threshold 1500
8
Mar 13, 2026
-210.6Policy Value
8
Mar 10, 2026
-189.4Score
8
Mar 10, 2026
-44.79Policy Value
8
Mar 10, 2026
236.4Performance (2/0.15)
8
Mar 10, 2026
192.4Steps Survived (Config 0.15)
8
Mar 10, 2026
98.2Performance Score (Config 2/0.85)
8
Mar 10, 2026
0.87Reward
8
Feb 26, 2026
75,033,713Average Return
8
Feb 26, 2026
728.49Normalized AUC
8
Feb 27, 2026
717.24Normalized AUC
8
Feb 27, 2026
313.78Normalized AUC
8
Feb 27, 2026
721.85Normalized AUC
8
Feb 27, 2026
493Average Episodic Return
8
Feb 26, 2026
673Average Episodic Return
8
Feb 26, 2026
659Avg Episodic Return
8
Feb 26, 2026
577Average Episodic Return
8
Feb 26, 2026
262Average Return
8
Feb 26, 2026
279Average Return
8
Feb 26, 2026
243Average Return
8
Feb 26, 2026
220Average Return
8
Feb 26, 2026
62Average Return
8
Feb 26, 2026
81Average Return
8
Feb 26, 2026
40Average Reward
8
May 12, 2026