Continuous control locomotion on MuJoCo Walker2d v3 (train)
6,482.6Final ReturnCGPO(*)
Evaluation Results
| Method | Links | ||||
|---|---|---|---|---|---|
| CGPO(*)Policy Type=Diffusion, Training Budget=10^6 steps2026.05 | 6,482.6 | — | — | — | |
| QVPOPolicy Type=Diffusion, Training Budget=10^6 steps2026.05 | 5,191.8 | — | — | — | |
| DIPOPolicy Type=Diffusion, Training Budget=10^6 steps2026.05 | 4,917.1 | — | — | — | |
| SACPolicy Type=Gaussian, Training Budget=10^6 steps2026.05 | 4,888.1 | — | — | — | |
| DACERPolicy Type=Diffusion, Training Budget=10^6 steps2026.05 | 4,381.7 | — | — | — | |
| SDACPolicy Type=Diffusion, Training Budget=10^6 steps2026.05 | 4,250.8 | — | — | — | |
| PPOPolicy Type=Gaussian, Training Budget=10^6 steps2026.05 | 3,751.5 | — | — | — | |
| QSMPolicy Type=Diffusion, Training Budget=10^6 steps2026.05 | 3,613.4 | — | — | — | |
| TD3Policy Type=Unimodal, Training Budget=10^6 steps2026.05 | 3,513.9 | — | — | — | |
| GePPOclipping parameter=0.1, value function estimator=V-trace2021.10 | 3,502 | 2,199 | 0.63 | 21 | |
| SPOPolicy Type=Gaussian, Training Budget=10^6 steps2026.05 | 3,321.8 | — | — | — | |
| PPOclipping parameter=0.2, batch size=20482021.10 | 3,041 | 1,817 | 1 | — |