Offline Reinforcement Learning on D4RL Gym walker2d medium
102.4Normalized ReturnRORL
Evaluation Results
| Method | Links | |
|---|---|---|
| RORLImplementation Source=Ours, Ensemble Size=102022.06 | 102.4 | |
| SPQRBase algorithm=SAC-Min2024.01 | 98.4 | |
| SPQRBase algorithm=EDAC2024.01 | 94.8 | |
| EDACImplementation=Ours2021.10 | 92.5 | |
| EDACImplementation Source=Paper2022.06 | 92.5 | |
| EDAC2024.01 | 92.5 | |
| PBRL2022.06 | 89.6 | |
| IPDEvaluation Protocol=Tenfold Episode Evaluation2026.03 | 89.5 | |
| GTP2025.10 | 89.5 | |
| SAC-NImplementation=Ours2021.10 | 87.9 | |
| SAC-Min2024.01 | 87.9 | |
| EDAC-10Implementation Source=Reproduced, Ensemble Size=102022.06 | 87.6 | |
| QTEvaluation Protocol=Tenfold Episode Evaluation2026.03 | 87.6 | |
| QIPO-OT2025.10 | 87.6 | |
| Repb-SDE2021.10 | 85.3 | |
| Repb-SDEalgorithm class=model-based2021.10 | 85.3 | |
| QQLDomain=Gym Locomotion, Hyperparameter Tuning=consistent2025.11 | 85.2 | |
| QIPO-Diff2025.10 | 85 | |
| ROMI-CQL2021.10 | 84.3 | |
| ROMI-CQLbase algorithm=CQL2021.10 | 84.3 | |
| XQLDomain=Gym Locomotion, Hyperparameter Tuning=individually tuned2025.11 | 84.2 | |
| SSCQL2025.10 | 84.2 | |
| CQL2021.10 | 83.8 | |
| CQLalgorithm class=model-free2021.10 | 83.8 | |
| MXQLDomain=Gym Locomotion, Hyperparameter Tuning=individually tuned2025.11 | 83.8 | |
| TD3+BCDomain=Gym Locomotion, Hyperparameter Tuning=individually tuned2025.11 | 83.7 | |
| CQLEvaluation Protocol=Tenfold Episode Evaluation2026.03 | 83 | |
| DDEvaluation Protocol=Tenfold Episode Evaluation2026.03 | 82.5 | |
| ReinformerEvaluation Protocol=Tenfold Episode Evaluation2026.03 | 80.5 | |
| BRACImplementation=Reproduced2021.10 | 79.6 | |
| CQLImplementation=Reproduced2021.10 | 79.5 | |
| CQL2022.06 | 79.5 | |
| IQLEvaluation Protocol=Tenfold Episode Evaluation2026.03 | 78.3 | |
| IQLDomain=Gym Locomotion, Hyperparameter Tuning=individually tuned2025.11 | 78.3 | |
| MOREL2021.10 | 77.8 | |
| COMBO2021.10 | 75.5 | |
| BCDomain=Gym Locomotion, Hyperparameter Tuning=individually tuned2025.11 | 75.3 | |
| CQLImplementation=Original Paper2021.10 | 74.5 | |
| CQL-Min2024.01 | 74.5 | |
| DTEvaluation Protocol=Tenfold Episode Evaluation2026.03 | 74 | |
| EDTEvaluation Protocol=Tenfold Episode Evaluation2026.03 | 72.8 | |
| CQLDomain=Gym Locomotion, Hyperparameter Tuning=individually tuned2025.11 | 72.5 | |
| ROMI-BCQ2021.10 | 72.4 | |
| BCQImplementation=Reproduced2021.10 | 71.8 | |
| BCImplementation=Reproduced2021.10 | 70.9 | |
| BC2022.06 | 70.9 | |
| BC2024.01 | 70.9 | |
| BAIL2021.10 | 68.8 | |
| QDTEvaluation Protocol=Tenfold Episode Evaluation2026.03 | 67.1 | |
| FQL2025.10 | 65.9 | |
| BEARImplementation=Reproduced2021.10 | 59.8 | |
| MORELImplementation=Reproduced2021.10 | 57 | |
| SAC-10Implementation Source=Reproduced, Ensemble Size=102022.06 | 46.7 | |
| BCQ2021.10 | 45.2 | |
| BC2021.10 | 41.7 | |
| BC2021.10 | 41.7 | |
| UWACImplementation=Reproduced2021.10 | 16 | |
| REMImplementation=Reproduced2021.10 | 0.2 | |
| BRAC-P2021.10 | 0.1 | |
| MOPO2021.10 | -0.2 | |
| SACImplementation=Reproduced2021.10 | -0.3 | |
| BEAR2021.10 | -0.3 | |
| BRAC-v2021.10 | -0.3 |