Reinforcement Learning on InvertedPendulum v2
1,000Mean RewardTTOpt
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| TTOptMode size (N)=32022.04 | 1,000 | 0 | |
| TTOptMode size (N)=2^82022.04 | 1,000 | 0 | |
| Delay-free SACDelta=02026.04 | 964.3 | — | |
| D2HPGDelta=52026.04 | 949.8 | — | |
| BPQLDelta=52026.04 | 945.5 | — | |
| D2HPGDelta=102026.04 | 937.3 | — | |
| Augmented SACDelta=52026.04 | 935.7 | — | |
| Augmented SACDelta=102026.04 | 932.2 | — | |
| Delayed SACDelta=52026.04 | 925.5 | — | |
| BPQLDelta=102026.04 | 919.7 | — | |
| GAMode size (N)=32022.04 | 893 | 283.1 | |
| VDPODelta=52026.04 | 764.5 | — | |
| CMAESMode size (N)=32022.04 | 721 | 335.37 | |
| Delayed SACDelta=102026.04 | 714.2 | — | |
| OPENESMode size (N)=32022.04 | 651.86 | 436.37 | |
| D2HPGDelta=202026.04 | 637.3 | — | |
| CMAESMode size (N)=2^82022.04 | 621 | 472.81 | |
| VDPODelta=102026.04 | 597.3 | — | |
| BPQLDelta=202026.04 | 568.1 | — | |
| Augmented SACDelta=202026.04 | 340.7 | — | |
| OPENESMode size (N)=2^82022.04 | 224.71 | 217.51 | |
| GAMode size (N)=2^82022.04 | 222.86 | 342.79 | |
| Delayed SACDelta=202026.04 | 67.7 | — | |
| Naive SACDelta=52026.04 | 32.1 | — | |
| Naive SACDelta=202026.04 | 24.3 | — | |
| Naive SACDelta=102026.04 | 20.7 | — | |
| VDPODelta=202026.04 | 19.4 | — |