Reinforcement Learning on Hopper v3
4,104Average Final ReturnDACER
Evaluation Results
| Method | Links | |
|---|---|---|
| DACER2024.05 | 4,104 | |
| DSAC2024.05 | 3,660 | |
| TD32024.05 | 3,569 | |
| TRPO2024.05 | 3,474 | |
| PPO2024.05 | 2,647 | |
| DDPG2024.05 | 2,644 | |
| D2HPGDelta=52026.04 | 2,509.8 | |
| SAC2024.05 | 2,483 | |
| Delay-free SACDelta=02026.04 | 2,435.2 | |
| D2HPGDelta=102026.04 | 2,374.8 | |
| Augmented SACDelta=52026.04 | 2,230.8 | |
| BPQLDelta=52026.04 | 2,136.3 | |
| BPQLDelta=102026.04 | 2,045.2 | |
| VDPODelta=102026.04 | 1,942.3 | |
| VDPODelta=52026.04 | 1,917.6 | |
| D2HPGDelta=202026.04 | 1,818.9 | |
| Delayed SACDelta=52026.04 | 1,536.6 | |
| BPQLDelta=202026.04 | 1,526.7 | |
| Delayed SACDelta=102026.04 | 1,403.1 | |
| VDPODelta=202026.04 | 1,359.5 | |
| Augmented SACDelta=102026.04 | 1,002.6 | |
| Delayed SACDelta=202026.04 | 595.5 | |
| Augmented SACDelta=202026.04 | 298.6 | |
| Naive SACDelta=52026.04 | 88.8 | |
| Naive SACDelta=102026.04 | 39.7 | |
| Naive SACDelta=202026.04 | 27.6 |