Reinforcement Learning on Walker2d v3
6,701Average Final ReturnDACER
Evaluation Results
| Method | Links | |
|---|---|---|
| DACER2024.05 | 6,701 | |
| DSAC2024.05 | 6,424 | |
| SAC2024.05 | 6,200 | |
| TRPO2024.05 | 5,502 | |
| TD32024.05 | 5,237 | |
| PPO2024.05 | 4,831 | |
| DDPG2024.05 | 4,095 | |
| VDPODelta=52026.04 | 3,402.9 | |
| Delay-free SACDelta=02026.04 | 3,305.5 | |
| D2HPGDelta=52026.04 | 2,704.7 | |
| VDPODelta=102026.04 | 2,588.4 | |
| BPQLDelta=52026.04 | 2,477.4 | |
| D2HPGDelta=102026.04 | 2,387.5 | |
| BPQLDelta=102026.04 | 2,331.6 | |
| Augmented SACDelta=102026.04 | 1,335.6 | |
| Augmented SACDelta=52026.04 | 1,265.4 | |
| D2HPGDelta=202026.04 | 1,151.6 | |
| Delayed SACDelta=52026.04 | 858.8 | |
| BPQLDelta=202026.04 | 846.7 | |
| VDPODelta=202026.04 | 795.2 | |
| Augmented SACDelta=202026.04 | 347.2 | |
| Delayed SACDelta=102026.04 | 207.5 | |
| Delayed SACDelta=202026.04 | 102.9 | |
| Naive SACDelta=102026.04 | 59.2 | |
| Naive SACDelta=202026.04 | 54.6 | |
| Naive SACDelta=52026.04 | 44.5 |