Reinforcement Learning on MuJoCo Ant v2
10,133Average ReturnTD7
Evaluation Results
| Method | Links | |
|---|---|---|
| TD7Time step=5M, Trials=62024.05 | 10,133 | |
| TD3+OFETime step=5M, Trials=62024.05 | 8,547 | |
| TD7Time step=1M, Trials=62024.05 | 8,509 | |
| RESeLTime step=5M, Trials=62024.05 | 8,006 | |
| TD3+OFETime step=1M, Trials=62024.05 | 7,398 | |
| TD3+OFETime step=300k, Trials=62024.05 | 6,348 | |
| TQCTime step=5M, Trials=62024.05 | 6,329 | |
| RESeLTime step=1M, Trials=62024.05 | 6,295 | |
| TD7Time step=300k, Trials=62024.05 | 6,171 | |
| TD3Time step=5M, Trials=62024.05 | 5,589 | |
| SACTime step=5M, Trials=62024.05 | 4,615 | |
| RESeLTime step=300k, Trials=62024.05 | 4,181 | |
| TD3Time step=1M, Trials=62024.05 | 3,942 | |
| SACTime step=1M, Trials=62024.05 | 3,681 | |
| TQCTime step=1M, Trials=62024.05 | 3,582 | |
| TQCTime step=300k, Trials=62024.05 | 1,830 | |
| TD3Time step=300k, Trials=62024.05 | 1,704 | |
| SACTime step=300k, Trials=62024.05 | 1,478 |