Reinforcement Learning on NeoRL halfcheetah-low
54.7Normalized ScoreMOBILE
Evaluation Results
| Method | Links | |
|---|---|---|
| MOBILELearning Mode=Offline, Seeds=52024.05 | 54.7 | |
| ADMPO-OFFLearning Mode=Offline, Seeds=52024.05 | 52.8 | |
| MOPOLearning Mode=Offline, Seeds=52024.05 | 40.1 | |
| MOBILETraining Steps=1M, Seeds=52026.03 | 38.9 | |
| CQLLearning Mode=Offline, Seeds=52024.05 | 38.2 | |
| ROMITraining Steps=1M, Seeds=52026.03 | 35.8 | |
| CQLTraining Steps=1M, Seeds=52026.03 | 35 | |
| MOPOTraining Steps=1M, Seeds=52026.03 | 34.2 | |
| IQLTraining Steps=1M, Seeds=52026.03 | 34.1 | |
| EDACLearning Mode=Offline, Seeds=52024.05 | 31.3 | |
| EDACTraining Steps=1M, Seeds=52026.03 | 31.3 | |
| RAMBOTraining Steps=1M, Seeds=52026.03 | 30.1 | |
| TD3+BCLearning Mode=Offline, Seeds=52024.05 | 30 | |
| BCLearning Mode=Offline, Seeds=52024.05 | 29.1 |