Offline-to-Online Reinforcement Learning on D4RL Antmaze
91Avg Normalized ReturnPEX
Evaluation Results
| Method | Links | |
|---|---|---|
| PEXReplay Buffer Strategy=ARB2025.12 | 91 | |
| FamO2OReplay Buffer Strategy=ARB2025.12 | 88.4 | |
| PEXReplay Buffer Strategy=Parallel2025.12 | 87.4 | |
| PEXReplay Buffer Strategy=Top-N2025.12 | 87.1 | |
| PEXReplay Buffer Strategy=BERB2025.12 | 86.5 | |
| FamO2OReplay Buffer Strategy=Parallel2025.12 | 85.8 | |
| Cal-QLReplay Buffer Strategy=ARB2025.12 | 85.2 | |
| PEXReplay Buffer Strategy=Naive2025.12 | 83.4 | |
| FamO2OReplay Buffer Strategy=BERB2025.12 | 83.3 | |
| FamO2OReplay Buffer Strategy=Top-N2025.12 | 83.2 | |
| Cal-QLReplay Buffer Strategy=Parallel2025.12 | 81.3 | |
| Cal-QLReplay Buffer Strategy=Naive2025.12 | 76.6 | |
| FamO2OReplay Buffer Strategy=Naive2025.12 | 75.8 | |
| Cal-QLReplay Buffer Strategy=BERB2025.12 | 75.3 | |
| Cal-QLReplay Buffer Strategy=Top-N2025.12 | 56.5 |