Reinforcement Learning on MuJoCo Walker2d v2
8,004Average ReturnRESeL
Evaluation Results
| Method | Links | |
|---|---|---|
| RESeLTime step=5M, Trials=62024.05 | 8,004 | |
| TD7Time step=5M, Trials=62024.05 | 7,397 | |
| TD3+OFETime step=5M, Trials=62024.05 | 6,379 | |
| TQCTime step=5M, Trials=62024.05 | 6,137 | |
| TD7Time step=1M, Trials=62024.05 | 6,097 | |
| SACTime step=5M, Trials=62024.05 | 5,681 | |
| RESeLTime step=1M, Trials=62024.05 | 5,410 | |
| TD7Time step=300k, Trials=62024.05 | 5,379 | |
| TQCTime step=1M, Trials=62024.05 | 5,321 | |
| TD3+OFETime step=1M, Trials=62024.05 | 5,195 | |
| TD3Time step=5M, Trials=62024.05 | 5,078 | |
| RESeLTime step=300k, Trials=62024.05 | 4,373 | |
| SACTime step=1M, Trials=62024.05 | 4,314 | |
| TD3+OFETime step=300k, Trials=62024.05 | 4,018 | |
| TD3Time step=1M, Trials=62024.05 | 3,946 | |
| TQCTime step=300k, Trials=62024.05 | 2,812 | |
| SACTime step=300k, Trials=62024.05 | 1,989 | |
| TD3Time step=300k, Trials=62024.05 | 1,101 |