Reinforcement Learning on AntMaze medium-play v2
97.4Final Score (1M Online Steps)SPOT
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| SPOTEvaluation Protocol=Online Fine-tuning after Offline RL, Online Steps=1M, Number of Seeds=52022.02 | 97.4 | 75.2 | 7.6 | |
| DMGTraining Mode=offline-to-online fine-tuning2024.11 | 96.8 | 80.2 | — | |
| IQLEvaluation Protocol=Online Fine-tuning after Offline RL, Online Steps=1M, Number of Seeds=52022.02 | 89.8 | 68.6 | — | |
| IQLTraining Mode=offline-to-online fine-tuning2024.11 | 89.8 | 76.4 | — | |
| TD3Training Mode=online training from scratch2024.11 | 0 | — | — |