Offline-to-Online Reinforcement Learning on D4RL Locomotion medium-expert
107.9Average Normalized ReturnFamO2O
Evaluation Results
| Method | Links | |
|---|---|---|
| FamO2OReplay Buffer Strategy=ARB2025.12 | 107.9 | |
| Cal-QLReplay Buffer Strategy=Top-N2025.12 | 107.6 | |
| Cal-QLReplay Buffer Strategy=ARB2025.12 | 106.9 | |
| Cal-QLReplay Buffer Strategy=BERB2025.12 | 106.7 | |
| Cal-QLReplay Buffer Strategy=Parallel2025.12 | 106.5 | |
| Cal-QLReplay Buffer Strategy=Naive2025.12 | 106.1 | |
| FamO2OReplay Buffer Strategy=Parallel2025.12 | 105.9 | |
| FamO2OReplay Buffer Strategy=BERB2025.12 | 105.5 | |
| FamO2OReplay Buffer Strategy=Naive2025.12 | 103.7 | |
| FamO2OReplay Buffer Strategy=Top-N2025.12 | 100.3 | |
| PEXReplay Buffer Strategy=ARB2025.12 | 86.2 | |
| PEXReplay Buffer Strategy=BERB2025.12 | 83.7 | |
| PEXReplay Buffer Strategy=Top-N2025.12 | 83.3 | |
| PEXReplay Buffer Strategy=Naive2025.12 | 82.7 | |
| PEXReplay Buffer Strategy=Parallel2025.12 | 80.8 |