Offline Reinforcement Learning on D4RL Gym walker2d (medium-replay)
109.7Normalized ReturnROMI-CQL
Evaluation Results
| Method | Links | |
|---|---|---|
| ROMI-CQL2021.10 | 109.7 | |
| ROMI-CQLbase algorithm=CQL2021.10 | 109.7 | |
| IPDEvaluation Protocol=Tenfold Episode Evaluation2026.03 | 96.2 | |
| QTEvaluation Protocol=Tenfold Episode Evaluation2026.03 | 94.2 | |
| GTP2025.10 | 94.2 | |
| EDAC-10Implementation Source=Reproduced, Ensemble Size=102022.06 | 94 | |
| TT(+Q)Configuration=Trifle2023.10 | 90.6 | |
| RORLImplementation Source=Ours, Ensemble Size=102022.06 | 90.4 | |
| QQLDomain=Gym Locomotion, Hyperparameter Tuning=consistent2025.11 | 90.2 | |
| QIPO-Diff2025.10 | 90.1 | |
| SAC-10Implementation Source=Reproduced, Ensemble Size=102022.06 | 89.6 | |
| SPQRBase algorithm=EDAC2024.01 | 89.6 | |
| CQLalgorithm class=model-free2021.10 | 88.4 | |
| TTConfiguration=Trifle2023.10 | 88.3 | |
| CQL2021.10 | 88.2 | |
| SPQRBase algorithm=SAC-Min2024.01 | 87.8 | |
| EDACImplementation=Ours2021.10 | 87.1 | |
| EDACImplementation Source=Paper2022.06 | 87.1 | |
| EDAC2024.01 | 87.1 | |
| SSCQL2025.10 | 85.9 | |
| TT(+Q)Configuration=base2023.10 | 84.6 | |
| Repb-SDE2021.10 | 83.8 | |
| Repb-SDEalgorithm class=model-based2021.10 | 83.8 | |
| MXQLDomain=Gym Locomotion, Hyperparameter Tuning=individually tuned2025.11 | 83.6 | |
| TTConfiguration=base2023.10 | 82.6 | |
| XQLDomain=Gym Locomotion, Hyperparameter Tuning=individually tuned2025.11 | 82.2 | |
| TD3(+BC)2023.10 | 81.8 | |
| TD3+BCDomain=Gym Locomotion, Hyperparameter Tuning=individually tuned2025.11 | 81.8 | |
| DTEvaluation Protocol=Tenfold Episode Evaluation2026.03 | 79.4 | |
| SAC-NImplementation=Ours2021.10 | 78.7 | |
| SAC-Min2024.01 | 78.7 | |
| QIPO-OT2025.10 | 78.6 | |
| PBRL2022.06 | 77.7 | |
| CQL2023.10 | 77.2 | |
| CQLEvaluation Protocol=Tenfold Episode Evaluation2026.03 | 77.2 | |
| CQLDomain=Gym Locomotion, Hyperparameter Tuning=individually tuned2025.11 | 77.2 | |
| CQLImplementation=Reproduced2021.10 | 76.8 | |
| CQL2022.06 | 76.8 | |
| DD2023.10 | 75 | |
| EDTEvaluation Protocol=Tenfold Episode Evaluation2026.03 | 74.8 | |
| IQL2023.10 | 73.9 | |
| IQLEvaluation Protocol=Tenfold Episode Evaluation2026.03 | 73.9 | |
| IQLDomain=Gym Locomotion, Hyperparameter Tuning=individually tuned2025.11 | 73.9 | |
| DTConfiguration=Trifle2023.10 | 73.5 | |
| ReinformerEvaluation Protocol=Tenfold Episode Evaluation2026.03 | 72.9 | |
| MOPO2021.10 | 69.4 | |
| DDEvaluation Protocol=Tenfold Episode Evaluation2026.03 | 68.9 | |
| DTConfiguration=base2023.10 | 66.6 | |
| %BC2023.10 | 62.5 | |
| QDTEvaluation Protocol=Tenfold Episode Evaluation2026.03 | 58.2 | |
| COMBO2021.10 | 56 | |
| BAIL2021.10 | 51.4 | |
| MOREL2021.10 | 49.8 | |
| ROMI-BCQ2021.10 | 49.5 | |
| BRACImplementation=Reproduced2021.10 | 47.9 | |
| BCQ2021.10 | 41.8 | |
| FQL2025.10 | 38.8 | |
| CQL-Min2024.01 | 32.6 | |
| UWACImplementation=Reproduced2021.10 | 27.1 | |
| BCDomain=Gym Locomotion, Hyperparameter Tuning=individually tuned2025.11 | 26 | |
| BCImplementation=Reproduced2021.10 | 20.3 | |
| BC2022.06 | 20.3 | |
| BC2024.01 | 20.3 | |
| BCQImplementation=Reproduced2021.10 | 12.5 | |
| MORELImplementation=Reproduced2021.10 | 12.2 | |
| BEARImplementation=Reproduced2021.10 | 9.3 | |
| BRAC-v2021.10 | 4.3 | |
| BC2021.10 | 2.2 | |
| BC2021.10 | 2.2 | |
| REMImplementation=Reproduced2021.10 | 1.9 | |
| BRAC-P2021.10 | 1.7 | |
| SACImplementation=Reproduced2021.10 | -0.4 | |
| BEAR2021.10 | -2.4 |