Policy Gradient on MuJoCo HalfCheetah (final 20 iterations)
-524Average ReturnHybrid (λ*)
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| Hybrid (λ*)lambda=optimal2025.11 | -524 | 75.7 | -53 | |
| REINFORCE2025.11 | -592.2 | 49.4 | — | |
| Pathwise2025.11 | -625 | 20.5 | 58 |
| Method | Links | |||
|---|---|---|---|---|
| Hybrid (λ*)lambda=optimal2025.11 | -524 | 75.7 | -53 | |
| REINFORCE2025.11 | -592.2 | 49.4 | — | |
| Pathwise2025.11 | -625 | 20.5 | 58 |