Reinforcement Learning on MuJoCo HalfCheetah v2
18,165Average ReturnTD7
Evaluation Results
| Method | Links | |
|---|---|---|
| TD7Time step=5M, Trials=62024.05 | 18,165 | |
| TQCTime step=5M, Trials=62024.05 | 17,459 | |
| TD7Time step=1M, Trials=62024.05 | 17,434 | |
| RESeLTime step=5M, Trials=62024.05 | 16,750 | |
| TD3+OFETime step=5M, Trials=62024.05 | 16,596 | |
| SACTime step=5M, Trials=62024.05 | 15,526 | |
| TD7Time step=300k, Trials=62024.05 | 15,031 | |
| TD3Time step=5M, Trials=62024.05 | 14,337 | |
| TD3+OFETime step=1M, Trials=62024.05 | 13,758 | |
| TQCTime step=1M, Trials=62024.05 | 12,349 | |
| RESeLTime step=1M, Trials=62024.05 | 12,327 | |
| TD3+OFETime step=300k, Trials=62024.05 | 11,294 | |
| TD3Time step=1M, Trials=62024.05 | 10,574 | |
| SACTime step=1M, Trials=62024.05 | 10,484 | |
| RESeLTime step=300k, Trials=62024.05 | 9,456 | |
| SACTime step=300k, Trials=62024.05 | 8,052 | |
| TD3Time step=300k, Trials=62024.05 | 7,715 | |
| TQCTime step=300k, Trials=62024.05 | 7,006 |