Offline Reinforcement Learning
Benchmarks
Dataset NameSOTA methodMetricTrendResultsLast Updated
99.4Normalized Reward
8
Feb 26, 2026
9,600Normalized Reward
8
Feb 26, 2026
91.5HalfCheetah (Medium-Expert)
8
Feb 26, 2026
61.6Normalized Score
8
Feb 26, 2026
0.967UMaze Score
8
Feb 26, 2026
115.5Normalized Score
8
Feb 26, 2026
89.9Normalized Score
8
Feb 26, 2026
92.5Normalized Score
8
Feb 26, 2026
17.9Normalized Score
8
Feb 26, 2026
112.6Normalized Score
8
Feb 26, 2026
103.9Normalized Score
8
Feb 26, 2026
31.9Normalized Score
8
Feb 26, 2026
108.2Normalized Score
8
Feb 26, 2026
74.9Normalized Score
8
Feb 26, 2026
78.7Normalized Score
8
Feb 26, 2026
39.5Normalized Score
8
Feb 26, 2026
24.8Average Score
8
Feb 26, 2026
28.83Average Score
8
Feb 26, 2026
17.21Avg Score
8
Feb 26, 2026
23.62Average Score
8
Feb 26, 2026
19.72Average Score
8
Feb 26, 2026
33.04Average Score
8
Feb 26, 2026
15Observation Error
8
Feb 26, 2026
0Observation Value
8
Feb 26, 2026
1.1Observation Deviation
8
Feb 26, 2026