Policy Optimization on MuJoCo Walker2d H=40
221.1ReturnMAX-RETURN
Evaluation Results
| Method | Links | |
|---|---|---|
| MAX-RETURNHorizon=40, Optimization Algorithm=SAC2022.06 | 221.1 | |
| OFF-SLHorizon=40, Optimization Algorithm=SAC2022.06 | 70.8 | |
| GALILEOHorizon=40, Optimization Algorithm=SAC2022.06 | 61.2 | |
| IPWHorizon=40, Optimization Algorithm=SAC2022.06 | 25.4 | |
| SCIGANHorizon=40, Optimization Algorithm=SAC2022.06 | 9.1 |