Offline Reinforcement Learning
Benchmarks
Dataset NameSOTA methodMetricTrendResultsLast Updated
108Reward
8
Feb 26, 2026
1,056.2Alien Score
8
Feb 26, 2026
450Mean Return
8
Feb 26, 2026
1,537.3Mean Return
8
Feb 26, 2026
1,551.2Mean Return
8
Feb 26, 2026
1,014Mean Return
8
Feb 26, 2026
396.4Mean Return
8
Feb 26, 2026
361.4Mean Return
8
Feb 26, 2026
265.3Median Human Normalized Score
8
Feb 26, 2026
189CVaR 0.1
7
Jun 29, 2026
1,475CVaR 0.1
7
Jun 29, 2026
1,590CVaR 0.1 Return
7
Jun 29, 2026
531CVaR 0.1
7
Jun 29, 2026
1,406CVaR 0.1
7
Jun 29, 2026
1,493CVaR 0.1
7
Jun 29, 2026
301CVaR 0.1
7
Jun 29, 2026
793CVaR (0.1)
7
Jun 29, 2026
292CVaR 0.1
7
Jun 29, 2026
46.6HalfCheetah MR Score
7
Jun 24, 2026
73.1Normalized Score
7
May 29, 2026
71Normalized Score
7
May 29, 2026
89AL Score
7
May 27, 2026
30Success Rate
7
May 12, 2026
71Success Rate
7
May 12, 2026
2,500.8Goal-weighted Return (G1 Speed)
7
Apr 28, 2026