Offline-to-Online Reinforcement Learning on D4RL Locomotion medium
98.3Average Normalized ReturnFamO2O
Evaluation Results
| Method | Links | |
|---|---|---|
| FamO2OReplay Buffer Strategy=ARB2025.12 | 98.3 | |
| FamO2OReplay Buffer Strategy=Parallel2025.12 | 92 | |
| FamO2OReplay Buffer Strategy=BERB2025.12 | 86.2 | |
| Cal-QLReplay Buffer Strategy=Top-N2025.12 | 86.1 | |
| Cal-QLReplay Buffer Strategy=ARB2025.12 | 86 | |
| Cal-QLReplay Buffer Strategy=Parallel2025.12 | 81.7 | |
| FamO2OReplay Buffer Strategy=Top-N2025.12 | 80.8 | |
| Cal-QLReplay Buffer Strategy=BERB2025.12 | 80 | |
| PEXReplay Buffer Strategy=ARB2025.12 | 75.7 | |
| PEXReplay Buffer Strategy=BERB2025.12 | 74.6 | |
| FamO2OReplay Buffer Strategy=Naive2025.12 | 74.5 | |
| PEXReplay Buffer Strategy=Parallel2025.12 | 73.2 | |
| PEXReplay Buffer Strategy=Top-N2025.12 | 72.3 | |
| Cal-QLReplay Buffer Strategy=Naive2025.12 | 69 | |
| PEXReplay Buffer Strategy=Naive2025.12 | 67.4 |