Reinforcement Learning on D4RL Hopper-Medium-Replay
98.33Normalized ReturnCORAL
Evaluation Results
| Method | Links | |
|---|---|---|
| CORALTraining Type=Offline2025.08 | 98.33 | |
| TD3+BCTraining Type=Offline2025.08 | 98.12 | |
| ATTraining Type=Offline2025.08 | 96.85 | |
| ADTraining Type=Offline2025.08 | 91.32 | |
| DTTraining Type=Offline2025.08 | 88.74 | |
| Adaptive Policy Selection and Fine-TuningPhase=Online, Online Interaction Budget=160 K2026.05 | 83.6 | |
| BestPhase=Offline, Online Interaction Budget=160 K2026.05 | 72.6 | |
| OEPhase=Offline, Online Interaction Budget=160 K2026.05 | 72.1 | |
| FTPhase=Online, Online Interaction Budget=160 K2026.05 | 35.2 | |
| OPEPhase=Offline, Online Interaction Budget=160 K2026.05 | 27 |