Continuous control locomotion on MuJoCo HalfCheetah v3 (train)
14,368.6Final PerformanceCGPO(*)
Evaluation Results
| Method | Links | ||||
|---|---|---|---|---|---|
| CGPO(*)Policy Type=Diffusion, Training Budget=10^6 steps2026.05 | 14,368.6 | — | — | — | |
| QVPOPolicy Type=Diffusion, Training Budget=10^6 steps2026.05 | 11,385.6 | — | — | — | |
| SDACPolicy Type=Diffusion, Training Budget=10^6 steps2026.05 | 11,179.4 | — | — | — | |
| SACPolicy Type=Gaussian, Training Budget=10^6 steps2026.05 | 10,616.9 | — | — | — | |
| TD3Policy Type=Unimodal, Training Budget=10^6 steps2026.05 | 10,388.6 | — | — | — | |
| DACERPolicy Type=Diffusion, Training Budget=10^6 steps2026.05 | 10,232.2 | — | — | — | |
| DIPOPolicy Type=Diffusion, Training Budget=10^6 steps2026.05 | 9,555 | — | — | — | |
| PPOPolicy Type=Gaussian, Training Budget=10^6 steps2026.05 | 4,773.5 | — | — | — | |
| SPOPolicy Type=Gaussian, Training Budget=10^6 steps2026.05 | 4,008.2 | — | — | — | |
| GePPOclipping parameter=0.1, value function estimator=V-trace2021.10 | 3,903 | 2,439 | 0.54 | 38 | |
| QSMPolicy Type=Diffusion, Training Budget=10^6 steps2026.05 | 3,888.2 | — | — | — | |
| PPOclipping parameter=0.2, batch size=20482021.10 | 3,223 | 1,764 | 1 | — |