Reinforcement Learning on SymNav V1
-104.58Average Normalized ReturnTD3
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| TD3Wall-clock (sec / 10^5 steps)=754±102026.05 | -104.58 | -172.08 | |
| SACWall-clock (sec / 10^5 steps)=410±122026.05 | -106.6 | -233.54 | |
| DDPGWall-clock (sec / 10^5 steps)=540±72026.05 | -106.97 | -206.47 | |
| RARLWall-clock (sec / 10^5 steps)=753±122026.05 | -114.53 | -155.27 | |
| DynRandWall-clock (sec / 10^5 steps)=581±122026.05 | -115.54 | -181.49 | |
| VPSD-RLVariant=Aug+Reg, Wall-clock (sec / 10^5 steps)=752±202026.05 | -124.48 | -145.78 | |
| EPOptWall-clock (sec / 10^5 steps)=485±272026.05 | -197.45 | -271.25 | |
| PPOWall-clock (sec / 10^5 steps)=217±352026.05 | -270.43 | -424.68 | |
| A2CWall-clock (sec / 10^5 steps)=175±12026.05 | -1,876.58 | -1,952.71 |