Offline-to-Online Reinforcement Learning
Benchmarks
Dataset NameSOTA methodMetricTrendResultsLast Updated
15.26Average Online Return
8
Jun 1, 2026
124.4Avg Online Return
8
Jun 1, 2026
96Online Success Rate
8
May 8, 2026
88Online Success Rate
8
May 8, 2026
90Online Success Rate
8
May 8, 2026
100Online Success Rate
8
May 8, 2026
100Online Success Rate
8
May 8, 2026
100Online Success Rate
8
May 8, 2026
544.4Regret
8
Feb 26, 2026
256.6Regret
8
Feb 26, 2026
353Regret
8
Feb 26, 2026
121.8Pen Score
7
Jul 2, 2026
98.7UMaze Success Rate
7
Jul 2, 2026
54.5HalfCheetah (M) Score
7
Jul 2, 2026
32AntMaze Giant Navigate Success Rate (Offline)
7
May 27, 2026
118Final Online Score
6
May 29, 2026
98Final Online Score
6
May 29, 2026
107.1Final Online Score
6
May 29, 2026
117.9Final Online Score
6
May 29, 2026
113.5Final Online Score
6
May 29, 2026
96.3Final Online Score
6
May 29, 2026
118.3Final Online Score
6
May 29, 2026
104.3Final Online Score
6
May 29, 2026
99.6Final Online Score
6
May 29, 2026
95.8Average Success Rate
6
May 11, 2026