Reinforcement Learning on MuJoCo Hopper v2
4,408Average ReturnRESeL
Evaluation Results
| Method | Links | |
|---|---|---|
| RESeLTime step=5M, Trials=62024.05 | 4,408 | |
| TD7Time step=5M, Trials=62024.05 | 4,075 | |
| TD3Time step=5M, Trials=62024.05 | 3,682 | |
| TQCTime step=1M, Trials=62024.05 | 3,526 | |
| TD7Time step=1M, Trials=62024.05 | 3,512 | |
| RESeLTime step=1M, Trials=62024.05 | 3,508 | |
| RESeLTime step=300k, Trials=62024.05 | 3,480 | |
| TQCTime step=5M, Trials=62024.05 | 3,462 | |
| TD3+OFETime step=5M, Trials=62024.05 | 3,423 | |
| TQCTime step=300k, Trials=62024.05 | 3,251 | |
| TD3Time step=1M, Trials=62024.05 | 3,226 | |
| SACTime step=5M, Trials=62024.05 | 3,167 | |
| TD3+OFETime step=1M, Trials=62024.05 | 3,121 | |
| TD7Time step=300k, Trials=62024.05 | 2,948 | |
| SACTime step=1M, Trials=62024.05 | 2,785 | |
| SACTime step=300k, Trials=62024.05 | 2,370 | |
| TD3+OFETime step=300k, Trials=62024.05 | 1,581 | |
| TD3Time step=300k, Trials=62024.05 | 1,289 |