Offline Reinforcement Learning on AntMaze umaze-diverse v2
73.4Initial ScoreIQL
Evaluation Results
| Method | Links | |||||
|---|---|---|---|---|---|---|
| IQLEvaluation Protocol=Online Fine-tuning after Offline RL, Online Steps=1M, Number of Seeds=52022.02 | 73.4 | 90.2 | — | — | — | |
| SPOTEvaluation Protocol=Online Fine-tuning after Offline RL, Online Steps=1M, Number of Seeds=52022.02 | 73 | 96.2 | 6 | — | — | |
| IQLEvaluation Protocol=Online Fine-tuning after Offline RL, Online Steps=1M, Number of Seeds=52022.02 | 70.8 | 62.2 | — | — | — | |
| SPOTEvaluation Protocol=Online Fine-tuning after Offline RL, Online Steps=1M, Number of Seeds=52022.02 | 44 | 90.8 | 17.4 | — | — | |
| SPOTEvaluation Protocol=Online Fine-tuning after Offline RL, Online Steps=1M, Number of Seeds=52022.02 | 41.6 | 96 | 33.8 | — | — | |
| IQLEvaluation Protocol=Online Fine-tuning after Offline RL, Online Steps=1M, Number of Seeds=52022.02 | 40.4 | 73.4 | — | — | — | |
| DMGTraining Mode=offline-to-online fine-tuning2024.11 | — | — | — | 75.4 | 89.2 | |
| IQLTraining Mode=offline-to-online fine-tuning2024.11 | — | — | — | 65.6 | 62.2 | |
| TD3Training Mode=online training from scratch2024.11 | — | — | — | — | 0 |