Reinforcement Learning on HalfCheetah v3
17,177Mean RewardDACER
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| DACER2024.05 | 17,177 | — | |
| DSAC2024.05 | 17,025 | — | |
| SAC2024.05 | 16,573 | — | |
| DDPG2024.05 | 13,970 | — | |
| TD32024.05 | 8,632 | — | |
| Delay-free SACDelta=02026.04 | 8,608.4 | — | |
| PPO2024.05 | 5,789 | — | |
| D2HPGDelta=52026.04 | 5,226.4 | — | |
| BPQLDelta=52026.04 | 5,216.3 | — | |
| VDPODelta=52026.04 | 4,819.5 | — | |
| TRPO2024.05 | 4,785 | — | |
| D2HPGDelta=102026.04 | 4,551.4 | — | |
| BPQLDelta=102026.04 | 4,266.6 | — | |
| TTOptMode size (N)=32022.04 | 4,211.02 | 211.94 | |
| D2HPGDelta=202026.04 | 4,089.4 | — | |
| VDPODelta=102026.04 | 3,328.5 | — | |
| GAMode size (N)=2^82022.04 | 3,085.8 | 842.76 | |
| TTOptMode size (N)=2^82022.04 | 2,935.9 | 544.11 | |
| CMAESMode size (N)=2^82022.04 | 2,879.46 | 929.55 | |
| BPQLDelta=202026.04 | 2,861.3 | — | |
| CMAESMode size (N)=32022.04 | 2,549.83 | 501.08 | |
| GAMode size (N)=32022.04 | 2,495.37 | 185.11 | |
| OPENESMode size (N)=32022.04 | 2,423.16 | 602.43 | |
| VDPODelta=202026.04 | 2,342.3 | — | |
| Augmented SACDelta=52026.04 | 2,130.9 | — | |
| Delayed SACDelta=52026.04 | 1,753.1 | — | |
| OPENESMode size (N)=2^82022.04 | 1,691.22 | 976.96 | |
| Augmented SACDelta=102026.04 | 946.2 | — | |
| Delayed SACDelta=102026.04 | 555.1 | — | |
| Delayed SACDelta=202026.04 | 552.5 | — | |
| Augmented SACDelta=202026.04 | 110.7 | — | |
| Naive SACDelta=202026.04 | -262.1 | — | |
| Naive SACDelta=52026.04 | -276.3 | — | |
| Naive SACDelta=102026.04 | -281.3 | — |