Online Reinforcement Learning on OpenAI Gym MuJoCo Normalized v4
95.5Normalized Mean ReturnNC-LQL
Evaluation Results
| Method | Links | |
|---|---|---|
| NC-LQLProgress=1.02026.02 | 95.5 | |
| NC-LQLProgress=0.82026.02 | 92.2 | |
| NC-LQLProgress=0.62026.02 | 91.4 | |
| DPMDProgress=0.82026.02 | 84.7 | |
| NC-LQLProgress=0.42026.02 | 84.5 | |
| DPMDProgress=1.02026.02 | 83.3 | |
| DPMDProgress=0.62026.02 | 80.2 | |
| DIPOProgress=1.02026.02 | 79.8 | |
| DIPOProgress=0.82026.02 | 79.6 | |
| SDACProgress=0.82026.02 | 78 | |
| SDACProgress=1.02026.02 | 76.7 | |
| DACERProgress=1.02026.02 | 76 | |
| DIPOProgress=0.62026.02 | 75.7 | |
| DACERProgress=0.82026.02 | 75.5 | |
| DPMDProgress=0.42026.02 | 75.4 | |
| DIPOProgress=0.42026.02 | 74.8 | |
| SDACProgress=0.62026.02 | 73.3 | |
| DPMDProgress=0.22026.02 | 72 | |
| DACERProgress=0.42026.02 | 71.9 | |
| SACProgress=1.02026.02 | 71.3 | |
| NC-LQLProgress=0.22026.02 | 71.2 | |
| SACProgress=0.82026.02 | 70.7 | |
| SDACProgress=0.42026.02 | 69.6 | |
| DACERProgress=0.62026.02 | 69.4 | |
| SACProgress=0.62026.02 | 66.4 | |
| SDACProgress=0.22026.02 | 65.1 | |
| MFPProgress=1.02026.02 | 64.8 | |
| SACProgress=0.42026.02 | 63.9 | |
| LQLProgress=0.82026.02 | 63.7 | |
| LQLProgress=1.02026.02 | 63.4 | |
| DIPOProgress=0.22026.02 | 62.2 | |
| MFPProgress=0.82026.02 | 61.4 | |
| DACERProgress=0.22026.02 | 61 | |
| MFPProgress=0.62026.02 | 61 | |
| LQLProgress=0.62026.02 | 57.7 | |
| LQLProgress=0.42026.02 | 56.2 | |
| QSMProgress=1.02026.02 | 55.3 | |
| QSMProgress=0.62026.02 | 55 | |
| MFPProgress=0.42026.02 | 54.5 | |
| QSMProgress=0.82026.02 | 53.9 | |
| QSMProgress=0.42026.02 | 53.3 | |
| LQLProgress=0.22026.02 | 52.6 | |
| SACProgress=0.22026.02 | 46.1 | |
| QSMProgress=0.22026.02 | 45.6 | |
| QVPOProgress=0.82026.02 | 45 | |
| QVPOProgress=1.02026.02 | 44.7 | |
| MFPProgress=0.22026.02 | 44.1 | |
| QVPOProgress=0.22026.02 | 42.9 | |
| QVPOProgress=0.42026.02 | 40.8 | |
| QVPOProgress=0.62026.02 | 38.6 |