Offline-to-Online Reinforcement Learning on D4RL Locomotion (random)
53.1Avg Normalized ReturnFamO2O
Evaluation Results
| Method | Links | |
|---|---|---|
| FamO2OReplay Buffer Strategy=ARB2025.12 | 53.1 | |
| FamO2OReplay Buffer Strategy=Parallel2025.12 | 40.9 | |
| FamO2OReplay Buffer Strategy=BERB2025.12 | 35.9 | |
| FamO2OReplay Buffer Strategy=Naive2025.12 | 30.5 | |
| FamO2OReplay Buffer Strategy=Top-N2025.12 | 26.3 | |
| PEXReplay Buffer Strategy=ARB2025.12 | 24.9 | |
| Cal-QLReplay Buffer Strategy=ARB2025.12 | 17.9 | |
| PEXReplay Buffer Strategy=Naive2025.12 | 15.4 | |
| PEXReplay Buffer Strategy=Parallel2025.12 | 15.3 | |
| PEXReplay Buffer Strategy=BERB2025.12 | 14.9 | |
| PEXReplay Buffer Strategy=Top-N2025.12 | 13.4 | |
| Cal-QLReplay Buffer Strategy=Parallel2025.12 | 11.6 | |
| Cal-QLReplay Buffer Strategy=BERB2025.12 | 11.2 | |
| Cal-QLReplay Buffer Strategy=Top-N2025.12 | 10.9 | |
| Cal-QLReplay Buffer Strategy=Naive2025.12 | 10.6 |