Reinforcement Learning on MuJoCo Humanoid
10,249Average ReturnSPMD
Evaluation Results
| Method | Links | |
|---|---|---|
| SPMD2023.05 | 10,249 | |
| SAC2023.05 | 6,923 | |
| SiMPO-Lin. Neg.Training Steps=1M2026.03 | 5,466 | |
| SiMPO-LinearTraining Steps=1M2026.03 | 5,376 | |
| SACTraining Steps=1M2026.03 | 5,298 | |
| TD3Training Steps=1M2026.03 | 5,263 | |
| DIPOTraining Steps=1M2026.03 | 5,184 | |
| SiMPO-ExpTraining Steps=1M2026.03 | 5,100 | |
| SiMPO-SquareTraining Steps=1M2026.03 | 5,068 | |
| DACERTraining Steps=1M2026.03 | 3,142 | |
| QSMTraining Steps=1M2026.03 | 2,308 | |
| QVPOTraining Steps=1M2026.03 | 1,375 |