Locomotion on MuJoCo Ant v3 (train)
7,272.1Best Episodic ReturnCGPO(*)
Evaluation Results
| Method | Links | |
|---|---|---|
| CGPO(*)Policy Type=Diffusion, Training Budget=10^6 steps2026.05 | 7,272.1 | |
| QVPOPolicy Type=Diffusion, Training Budget=10^6 steps2026.05 | 6,425.1 | |
| DIPOPolicy Type=Diffusion, Training Budget=10^6 steps2026.05 | 6,100 | |
| DACERPolicy Type=Diffusion, Training Budget=10^6 steps2026.05 | 5,910.8 | |
| SACPolicy Type=Gaussian, Training Budget=10^6 steps2026.05 | 5,030.9 | |
| TD3Policy Type=Unimodal, Training Budget=10^6 steps2026.05 | 4,583.8 | |
| PPOPolicy Type=Gaussian, Training Budget=10^6 steps2026.05 | 2,781.9 | |
| SPOPolicy Type=Gaussian, Training Budget=10^6 steps2026.05 | 2,100.2 | |
| SDACPolicy Type=Diffusion, Training Budget=10^6 steps2026.05 | 1,404.6 |