Navigation on D4RL AntMaze large-play v2
55.83Normalized D4RL ScoreO2PPO
Evaluation Results
| Method | Links | |
|---|---|---|
| O2PPOLearning Stage=Online fine-tuning, Environment steps=250,0002024.12 | 55.83 | |
| PEXLearning Stage=Online fine-tuning2024.12 | 54.6 | |
| IQLLearning Stage=Online fine-tuning2024.12 | 50.2 | |
| PEXLearning Stage=Offline2024.12 | 46.2 | |
| O2SACLearning Stage=Online fine-tuning, Environment steps=200,000, Double Q networks=false2024.12 | 44.2 | |
| IQLLearning Stage=Offline2024.12 | 39.4 | |
| O2PPOLearning Stage=Offline2024.12 | 38 | |
| O2SACLearning Stage=Offline2024.12 | 19.8 | |
| AWACLearning Stage=Offline2024.12 | 0 | |
| AWACLearning Stage=Online fine-tuning2024.12 | 0 |