Offline Reinforcement Learning
Benchmarks
Dataset NameSOTA methodMetricTrendResultsLast Updated
92.3AntMaze UMaze v0 Score
9
Feb 26, 2026
162.7Adroit v0 Aggregate Score
9
Feb 26, 2026
180Maze2D Large Score
9
Feb 26, 2026
60Score (HalfCheetah-M)
9
Feb 26, 2026
36Cube Triple Score
8
Jun 23, 2026
82Normalized Score
8
Jun 15, 2026
46.2Normalized Score
8
Jun 15, 2026
83.7Normalized Score
8
Jun 15, 2026
48.4Normalized Score
8
Jun 15, 2026
93Normalized Score
8
Jun 15, 2026
103.4Normalized Average Return
8
Jun 4, 2026
105.8Normalized Score
8
May 29, 2026
101Normalized Score
8
May 29, 2026
80.9Normalized Score
8
May 29, 2026
0.757Return
8
May 26, 2026
87.8Score (pen-human)
8
May 12, 2026
107.8Normalized Score
8
May 11, 2026
112.5Normalized Score
8
May 11, 2026
73.56Average Normalized Performance
8
Apr 15, 2026
83.2Normalized Performance Score
8
Apr 15, 2026
95.535Normalized Score
8
Mar 4, 2026
59.724Normalized Score
8
Mar 4, 2026
65.863Normalized Score
8
Mar 4, 2026
90.168Normalized Score
8
Mar 4, 2026
32.318Normalized Score
8
Mar 4, 2026