Continuous Control Locomotion on MuJoCo Hopper v3 (train)
4,170.5Best Episodic ReturnCGPO(*)
Evaluation Results
| Method | Links | |||||
|---|---|---|---|---|---|---|
| CGPO(*)Policy Type=Diffusion, Training Budget=10^6 steps2026.05 | 4,170.5 | — | — | — | — | |
| QVPOPolicy Type=Diffusion, Training Budget=10^6 steps2026.05 | 3,728.5 | — | — | — | — | |
| DIPOPolicy Type=Diffusion, Training Budget=10^6 steps2026.05 | 3,724.1 | — | — | — | — | |
| DACERPolicy Type=Diffusion, Training Budget=10^6 steps2026.05 | 3,436.3 | — | — | — | — | |
| TD3Policy Type=Unimodal, Training Budget=10^6 steps2026.05 | 3,267.5 | — | — | — | — | |
| PPOPolicy Type=Gaussian, Training Budget=10^6 steps2026.05 | 3,154.3 | — | — | — | — | |
| SACPolicy Type=Gaussian, Training Budget=10^6 steps2026.05 | 2,996.6 | — | — | — | — | |
| SDACPolicy Type=Diffusion, Training Budget=10^6 steps2026.05 | 2,957.8 | — | — | — | — | |
| SPOPolicy Type=Gaussian, Training Budget=10^6 steps2026.05 | 2,212.8 | — | — | — | — | |
| QSMPolicy Type=Diffusion, Training Budget=10^6 steps2026.05 | 2,154.7 | — | — | — | — | |
| GePPOclipping parameter=0.1, value function estimator=V-trace2021.10 | — | 2,544 | 3,450 | 0.41 | — | |
| PPOclipping parameter=0.2, batch size=20482021.10 | — | 2,362 | 3,126 | 1 | — |