Locomotion on D4RL Hopper Random
63.3Mean ReturnAdaptive Policy Selection and Fine-Tuning
Evaluation Results
| Method | Links | |
|---|---|---|
| Adaptive Policy Selection and Fine-TuningPhase=Online, Strategy=Ours, Online Interaction Budget=320 K2026.05 | 63.3 | |
| FTPhase=Online, Strategy=FT, Online Interaction Budget=320 K2026.05 | 61.5 | |
| BestPhase=Offline, Strategy=Best2026.05 | 2.8 | |
| OEPhase=Online, Strategy=OE, Online Interaction Budget=320 K2026.05 | 2.8 | |
| OPEPhase=Offline, Strategy=OPE2026.05 | 0.5 |