Offline Reinforcement Learning on AntMaze umaze v2
99.2Final ScoreSPOT
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| SPOTEvaluation Protocol=Online Fine-tuning after Offline RL, Online Steps=1M, Number of Seeds=52022.02 | 99.2 | 93.2 | 3 | |
| DMGTraining Mode=offline-to-online fine-tuning2024.11 | 98.4 | 92.4 | — | |
| IQLEvaluation Protocol=Online Fine-tuning after Offline RL, Online Steps=1M, Number of Seeds=52022.02 | 96.2 | 85.4 | — | |
| IQLTraining Mode=offline-to-online fine-tuning2024.11 | 96.2 | 89.6 | — | |
| TD3Training Mode=online training from scratch2024.11 | 0 | — | — |