Offline-to-Online Reinforcement Learning
Benchmarks
Dataset NameSOTA methodMetricTrendResultsLast Updated
74.51Success Rate (Large Diverse)
20
May 15, 2026
77.6Average Normalized Score
17
Jul 2, 2026
0.031Normalized Regret
16
Feb 26, 2026
91Avg Normalized Return
15
Feb 26, 2026
107.9Average Normalized Return
15
Feb 26, 2026
98.3Average Normalized Return
15
Feb 26, 2026
90.8Avg Normalized Return
15
Feb 26, 2026
53.1Avg Normalized Return
15
Feb 26, 2026
46.65Partial Success Rate
12
May 15, 2026
62.8Regret
12
Feb 26, 2026
5.3Regret
12
Feb 26, 2026
50.3Regret
12
Feb 26, 2026
88.36HalfCheetah Return (Random)
10
May 15, 2026
17.1Breakout Score (Online)
10
May 13, 2026
9.7Online Normalized Score
9
May 13, 2026
16.9Online Score
9
May 13, 2026
14.8Online Normalized Score
9
May 13, 2026
15.9Online Normalised Score
9
May 13, 2026
47.1Online Normalised Score
9
May 13, 2026
47.9Online Normalized Score
9
May 13, 2026
81.7OSR
9
May 13, 2026
81.7OSR
9
May 13, 2026
46.71Average Online Return
8
Jun 1, 2026
0.44Average Online Expected Return
8
Jun 1, 2026
46.74Average Online Expected Return
8
Jun 1, 2026