Reinforcement Learning on Gym-MuJoCo Walker2D
4,909Average ReturnSiMPO-Linear
Evaluation Results
| Method | Links | |
|---|---|---|
| SiMPO-LinearTraining Steps=1M2026.03 | 4,909 | |
| SiMPO-Lin. Neg.Training Steps=1M2026.03 | 4,906 | |
| SACTraining Steps=1M2026.03 | 4,625 | |
| SiMPO-ExpTraining Steps=1M2026.03 | 4,616 | |
| SiMPO-SquareTraining Steps=1M2026.03 | 4,478 | |
| QSMTraining Steps=1M2026.03 | 3,933 | |
| DIPOTraining Steps=1M2026.03 | 3,809 | |
| TD3Training Steps=1M2026.03 | 3,732 | |
| QVPOTraining Steps=1M2026.03 | 2,866 | |
| DACERTraining Steps=1M2026.03 | 1,871 |