Training Efficiency on Humanoid Locomotion Simulation
24.3Progress Score (30 min)Baseline RL
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| Baseline RLReward Method=Baseline RL2026.06 | 24.3 | 52.6 | 63.7 | |
| OGMPReward Method=OGMP2026.06 | 22.9 | 26.7 | 33 | |
| MPC-RL (Averaged)Reward Method=MPC-RL, Reward Weighting Schedule={0.2, 0.2, 0.2, 0.2, 0.2}2026.06 | 21.9 | 28.2 | 71.5 | |
| MPC-RL (Next-step)Reward Method=MPC-RL, Reward Weighting Schedule={1, 0, 0, 0, 0}2026.06 | 18.7 | 25 | 68.7 | |
| MPC-RL (Tapered)Reward Method=MPC-RL, Reward Weighting Schedule={0.5, 0.25, 0.15, 0.07, 0.03}2026.06 | 16.7 | 60 | 77.7 | |
| CLF-RLReward Method=CLF-RL2026.06 | 11.8 | 18.9 | 54.9 |