Reinforcement Learning on AntMaze large-play v2
89.4Final Score (1M Online Steps)SPOT
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| SPOTEvaluation Protocol=Online Fine-tuning after Offline RL, Online Steps=1M, Number of Seeds=52022.02 | 89.4 | 40.8 | 10.8 | |
| DMGTraining Mode=offline-to-online fine-tuning2024.11 | 86.8 | 55.4 | — | |
| IQLEvaluation Protocol=Online Fine-tuning after Offline RL, Online Steps=1M, Number of Seeds=52022.02 | 78.6 | 40 | — | |
| IQLTraining Mode=offline-to-online fine-tuning2024.11 | 78.6 | 42 | — | |
| TD3Training Mode=online training from scratch2024.11 | 0 | — | — |