Reinforcement Learning on HalfCheetah (Average Return)
7,223.53Average ReturnDiff-SR
Evaluation Results
| Method | Links | |
|---|---|---|
| Diff-SRRL Category=Representation RL, Steps=200K, Seeds=42024.06 | 7,223.53 | |
| LV-RepRL Category=Representation RL, Steps=200K, Seeds=42024.06 | 5,557.6 | |
| SACNumber of training seeds=5, Number of evaluation episodes=1002026.03 | 4,988.5 | |
| SPEDERL Category=Representation RL, Steps=200K, Seeds=42024.06 | 4,210.3 | |
| DeepSFRL Category=Representation RL, Steps=200K, Seeds=42024.06 | 4,180.4 | |
| SACRL Category=Model-Free RL, Layers=3-layer, Steps=200K, Seeds=42024.06 | 4,000.7 | |
| Best MBBLRL Category=Model-Based RL, Steps=200K, Seeds=42024.06 | 3,639 | |
| SMACbatch size=1000, seeds=52026.01 | 2,936 | |
| PETS-CEMRL Category=Model-Based RL, Steps=200K, Seeds=42024.06 | 2,795.3 | |
| PolyGRADRL Category=Model-Based RL, Steps=200K, Seeds=42024.06 | 2,563.5 | |
| CG-FPDNumber of training seeds=5, Number of evaluation episodes=1002026.03 | 2,407.88 | |
| ME-TRPORL Category=Model-Based RL, Steps=200K, Seeds=42024.06 | 2,283.7 | |
| DF-CWP-CPNumber of training seeds=5, Number of evaluation episodes=1002026.03 | 2,103.8 | |
| AC-CGbatch size=1000, seeds=52026.01 | 1,766 | |
| PPONumber of training seeds=5, Number of evaluation episodes=1002026.03 | 1,579.13 | |
| PETS-RSRL Category=Model-Based RL, Steps=200K, Seeds=42024.06 | 966.9 | |
| A2CNumber of training seeds=5, Number of evaluation episodes=1002026.03 | 795.91 | |
| AC-KFACbatch size=1000, seeds=52026.01 | 513 | |
| PPORL Category=Model-Free RL, Steps=200K, Seeds=42024.06 | 17.2 | |
| TRPORL Category=Model-Free RL, Steps=200K, Seeds=42024.06 | -12 | |
| AC-Adambatch size=1000, seeds=52026.01 | -646 | |
| AC-SGDbatch size=1000, seeds=52026.01 | -1,672 |