Offline-to-Online Reinforcement Learning on D4RL Locomotion medium-replay
90.8Avg Normalized ReturnFamO2O
Evaluation Results
| Method | Links | |
|---|---|---|
| FamO2OReplay Buffer Strategy=ARB2025.12 | 90.8 | |
| FamO2OReplay Buffer Strategy=BERB2025.12 | 86.2 | |
| Cal-QLReplay Buffer Strategy=ARB2025.12 | 86 | |
| FamO2OReplay Buffer Strategy=Naive2025.12 | 86 | |
| Cal-QLReplay Buffer Strategy=Top-N2025.12 | 84.5 | |
| FamO2OReplay Buffer Strategy=Parallel2025.12 | 84.5 | |
| Cal-QLReplay Buffer Strategy=BERB2025.12 | 83 | |
| Cal-QLReplay Buffer Strategy=Parallel2025.12 | 82.9 | |
| PEXReplay Buffer Strategy=ARB2025.12 | 82.9 | |
| Cal-QLReplay Buffer Strategy=Naive2025.12 | 81.9 | |
| FamO2OReplay Buffer Strategy=Top-N2025.12 | 81.5 | |
| PEXReplay Buffer Strategy=Top-N2025.12 | 76.2 | |
| PEXReplay Buffer Strategy=BERB2025.12 | 61.7 | |
| PEXReplay Buffer Strategy=Naive2025.12 | 58.4 | |
| PEXReplay Buffer Strategy=Parallel2025.12 | 57.9 |