Reinforcement Learning
Benchmarks
Dataset NameSOTA methodMetricTrendResultsLast Updated
84.6Normalized Win Score (NWS)
6
Jun 16, 2026
1.098Normalized Win Score (NWS)
6
Jun 16, 2026
1.09Normalized Win Score (NWS)
6
Jun 16, 2026
2,726Final Score
6
Jun 8, 2026
11,716Score
6
Jun 8, 2026
104,010Score
6
Jun 8, 2026
-32.42Selected Score
6
Jun 5, 2026
-41.98Return (Selected)
6
Jun 5, 2026
113Task 1 Score
6
May 27, 2026
2.8Normalized Reward
6
May 22, 2026
1.65Normalized Reward
6
May 22, 2026
1.11Normalized Reward
6
May 22, 2026
1.28Normalized Reward
6
May 22, 2026
100Normalized Reward
6
May 22, 2026
1Normalized Reward
6
May 22, 2026
116.8Steps to 75% Return
6
May 18, 2026
120Steps to 75% Return
6
May 18, 2026
205,000Steps to 75% Return Threshold
6
May 18, 2026
330,500Steps to Reach 75% Return
6
May 18, 2026
76,600Steps to 75% Return (k)
6
May 18, 2026
153,500Steps to 75% Return
6
May 18, 2026
333.4Steps to 75% Return
6
May 18, 2026
77,300Steps to 75% Return
6
May 18, 2026
89,100Steps to 75% Return
6
May 18, 2026
104,700Steps to 75% Return
6
May 18, 2026