Reinforcement Learning on MuJoCo Humanoid v2
10,490Average ReturnRESeL
Evaluation Results
| Method | Links | |
|---|---|---|
| RESeLTime step=5M, Trials=62024.05 | 10,490 | |
| TD7Time step=5M, Trials=62024.05 | 10,281 | |
| TD3+OFETime step=5M, Trials=62024.05 | 8,951 | |
| TQCTime step=5M, Trials=62024.05 | 8,361 | |
| TD7Time step=1M, Trials=62024.05 | 7,429 | |
| RESeLTime step=1M, Trials=62024.05 | 7,280 | |
| SACTime step=5M, Trials=62024.05 | 6,555 | |
| TD3+OFETime step=1M, Trials=62024.05 | 6,032 | |
| TQCTime step=1M, Trials=62024.05 | 6,029 | |
| TD3Time step=5M, Trials=62024.05 | 5,433 | |
| TD7Time step=300k, Trials=62024.05 | 5,332 | |
| TD3Time step=1M, Trials=62024.05 | 5,165 | |
| SACTime step=1M, Trials=62024.05 | 4,909 | |
| RESeLTime step=300k, Trials=62024.05 | 4,578 | |
| TD3+OFETime step=300k, Trials=62024.05 | 3,181 | |
| TQCTime step=300k, Trials=62024.05 | 3,117 | |
| SACTime step=300k, Trials=62024.05 | 1,997 | |
| TD3Time step=300k, Trials=62024.05 | 1,344 |