Reinforcement Learning on D4RL AntMaze v0 (online fine-tuning)
96.9Success Rate (umaze-v0)AWAC + FamO2O
Evaluation Results
| Method | Links | |||||||
|---|---|---|---|---|---|---|---|---|
| AWAC + FamO2Omode=Ours (augmented), seeds=62023.10 | 96.9 | 90.5 | 2,220 | 34.2 | 0 | 0 | 243.7 | |
| Average (AWAC, IQL) + FamO2Omode=Ours (augmented), seeds=62023.10 | 96.8 | 80.6 | 5,760 | 63.6 | 32.1 | 30.3 | 361.1 | |
| IQL + FamO2Omode=Ours (augmented), seeds=62023.10 | 96.7 | 70.8 | 9,300 | 93 | 64.2 | 60.7 | 478.3 | |
| IQLmode=Base, seeds=62023.10 | 96.5 | 37.8 | 9,280 | 91.5 | 57.5 | 52.5 | 428.7 | |
| Average (AWAC, IQL)mode=Base, seeds=62023.10 | 80.4 | 66.2 | 4,520 | 45.2 | 24.7 | 21.4 | 283.1 | |
| AWACmode=Base, seeds=62023.10 | 64 | 60.4 | 20 | 0 | 0 | 0 | 124.7 |