Locomotion on MuJoCo Humanoid v3 (train)
7,131.4Best Episodic ReturnCGPO(*)
Evaluation Results
| Method | Links | |
|---|---|---|
| CGPO(*)Policy Type=Diffusion, Training Budget=10^6 steps2026.05 | 7,131.4 | |
| TD3Policy Type=Unimodal, Training Budget=10^6 steps2026.05 | 5,353.5 | |
| QVPOPolicy Type=Diffusion, Training Budget=10^6 steps2026.05 | 5,306.6 | |
| DACERPolicy Type=Diffusion, Training Budget=10^6 steps2026.05 | 5,291.3 | |
| DIPOPolicy Type=Diffusion, Training Budget=10^6 steps2026.05 | 5,280.1 | |
| SACPolicy Type=Gaussian, Training Budget=10^6 steps2026.05 | 5,159.7 | |
| QSMPolicy Type=Diffusion, Training Budget=10^6 steps2026.05 | 4,793.1 | |
| SDACPolicy Type=Diffusion, Training Budget=10^6 steps2026.05 | 4,429.6 | |
| SPOPolicy Type=Gaussian, Training Budget=10^6 steps2026.05 | 797.4 | |
| PPOPolicy Type=Gaussian, Training Budget=10^6 steps2026.05 | 713.7 |