Offline Reinforcement Learning
Benchmarks
Dataset NameSOTA methodMetricTrendResultsLast Updated
108.8Mean Normalized Score
31
May 11, 2026
155.8Return (UMaze)
31
Apr 15, 2026
220.66Normalized Return
30
May 26, 2026
166.82Normalized Return
30
May 26, 2026
100UMaze Success Rate
30
May 29, 2026
72.1Normalized Avg Return
30
Jun 4, 2026
105.9Score (HalfCheetah, Medium-Expert)
30
May 29, 2026
54.1Reward
30
May 8, 2026
152Normalized Performance
29
Jun 15, 2026
2,280Normalized Score
29
Apr 15, 2026
860Normalized Score
29
Apr 15, 2026
21.1Mean Normalized Score
29
Apr 15, 2026
95.6Average Normalized Score
29
Feb 26, 2026
114.7Normalized Average Return
29
Jun 4, 2026
52.2Avg Normalized Return
29
Feb 26, 2026
46.1Adroit Door Return (Human)
29
Feb 26, 2026
77.8Normalized Score
29
Feb 26, 2026
24Mean Normalized Score
28
Apr 15, 2026
78Average Success Rate
28
Mar 4, 2026
45.4Normalized Score
28
May 14, 2026
53.6Normalized Score
28
May 14, 2026
87.7Normalized Avg Return
28
Jun 4, 2026
109.803Average Return
27
Mar 4, 2026
82.786Average Return
27
Mar 4, 2026
94.578Average Return
27
Mar 4, 2026