Reinforcement Learning on D4RL Ant Medium
94.25D4RL ScoreTransformer
Evaluation Results
| Method | Links | |
|---|---|---|
| Transformer2024.05 | 94.25 | |
| Aaren2024.05 | 93.29 | |
| Adaptive Policy Selection and Fine-TuningPhase=Online, Online Interaction Budget=160 K2026.05 | 82.3 | |
| BestPhase=Offline, Online Interaction Budget=160 K2026.05 | 69.7 | |
| OEPhase=Offline, Online Interaction Budget=160 K2026.05 | 69.7 | |
| OPEPhase=Offline, Online Interaction Budget=160 K2026.05 | 33.6 | |
| FTPhase=Online, Online Interaction Budget=160 K2026.05 | 22.8 |