Offline Reinforcement Learning
Benchmarks
Dataset NameSOTA methodMetricTrendResultsLast Updated
9,240AntMaze-Medium
8
Feb 26, 2026
88.8AntMaze Medium Score
8
Feb 26, 2026
100.02Avg Normalized Score
8
Feb 26, 2026
47.5Normalized Score
8
Feb 26, 2026
39.6Normalized Score
8
Feb 26, 2026
85.4Normalized Score
8
Feb 26, 2026
81.8Normalized Score
8
Feb 26, 2026
45.4HalfCheetah Return
8
Feb 26, 2026
95HalfCheetah Score
8
Feb 26, 2026
47.5Score
8
Feb 26, 2026
35.4HalfCheetah Return (Random)
8
Feb 26, 2026
108.4Normalized Score
8
Feb 26, 2026
112.7Normalized Avg Score
8
Feb 26, 2026
105Normalized Score
8
Feb 26, 2026
82Normalized Score
8
Feb 26, 2026
100.4Avg Score (Normalized)
8
Feb 26, 2026
45.1Normalized Score
8
Feb 26, 2026
42.6Normalized Score
8
Feb 26, 2026
67.5Normalized Avg Score
8
Feb 26, 2026
53.1Normalized Score
8
Feb 26, 2026
13.6Normalized Score
8
Feb 26, 2026
11.9Normalized Score
8
Feb 26, 2026
35.4Normalized Average Score
8
Feb 26, 2026
73.5Average Reward
8
Feb 26, 2026
62.9Reward
8
Feb 26, 2026