Reinforcement Learning on Ant v3
9,108Average Final ReturnDACER
Evaluation Results
| Method | Links | |
|---|---|---|
| DACER2024.05 | 9,108 | |
| DSAC2024.05 | 7,086 | |
| SAC2024.05 | 6,427 | |
| TRPO2024.05 | 6,203 | |
| TD32024.05 | 6,184 | |
| PPO2024.05 | 6,156 | |
| DDPG2024.05 | 4,549 | |
| VDPODelta=52026.04 | 4,373.3 | |
| D2HPGDelta=52026.04 | 3,852.3 | |
| BPQLDelta=52026.04 | 3,754.1 | |
| Delay-free SACDelta=02026.04 | 3,279.2 | |
| VDPODelta=102026.04 | 3,085.2 | |
| D2HPGDelta=102026.04 | 3,010.6 | |
| BPQLDelta=102026.04 | 2,824.9 | |
| D2HPGDelta=202026.04 | 2,694.3 | |
| VDPODelta=202026.04 | 2,419.7 | |
| BPQLDelta=202026.04 | 2,069.5 | |
| Delayed SACDelta=52026.04 | 1,093.6 | |
| Delayed SACDelta=102026.04 | 924.3 | |
| Augmented SACDelta=52026.04 | 881.9 | |
| Augmented SACDelta=102026.04 | 880.7 | |
| Delayed SACDelta=202026.04 | 817.9 | |
| Augmented SACDelta=202026.04 | 697.4 | |
| Naive SACDelta=52026.04 | -74.9 | |
| Naive SACDelta=102026.04 | -79.2 | |
| Naive SACDelta=202026.04 | -83.9 |