Offline Reinforcement Learning on D4RL AntMaze v0 (test)
87.5Umaze ScoreIQL
Evaluation Results
| Method | Links | |||||||
|---|---|---|---|---|---|---|---|---|
| IQLMethod Category=Model-free, Normalization Procedure=[14], Evaluation Window=last 10 iterations, Seeds=52022.04 | 87.5 | 71.2 | 39.6 | 62.2 | 70 | 47.5 | 378 | |
| COMBOMethod Category=Model-based, Normalization Procedure=[14], Evaluation Window=last 10 iterations, Seeds=52022.04 | 80.3 | 0 | 0 | 57.3 | 0 | 0 | 137.6 | |
| TD3+BCMethod Category=Model-free, Normalization Procedure=[14], Evaluation Window=last 10 iterations, Seeds=52022.04 | 78.6 | 3 | 0 | 71.4 | 10.6 | 0.2 | 163.8 | |
| CQLMethod Category=Model-free, Normalization Procedure=[14], Evaluation Window=last 10 iterations, Seeds=52022.04 | 74 | 61.2 | 15.8 | 84 | 53.7 | 14.9 | 303.6 | |
| BCMethod Category=Model-free, Normalization Procedure=[14], Evaluation Window=last 10 iterations, Seeds=52022.04 | 65 | 0 | 0 | 55 | 0 | 0 | 120 | |
| RAMBOMethod Category=Model-based, Normalization Procedure=[14], Evaluation Window=last 10 iterations, Seeds=52022.04 | 25 | 16.4 | 0 | 0 | 23.2 | 2.4 | 67 | |
| RAMBO^OFFMethod Category=Model-based, Normalization Procedure=[14], Evaluation Window=last 10 iterations, Seeds=52022.04 | 23.8 | 5.6 | 0 | 0 | 8.4 | 0 | 37.8 | |
| RepB-SDEMethod Category=Model-based, Normalization Procedure=[14], Evaluation Window=last 10 iterations, Seeds=52022.04 | 0 | 0 | 0 | 0 | 0 | 0 | 0 | |
| MOPOMethod Category=Model-based, Normalization Procedure=[14], Evaluation Window=last 10 iterations, Seeds=52022.04 | 0 | 0 | 0 | 0 | 0 | 0 | 0 | |
| MOReLMethod Category=Model-based, Normalization Procedure=[14], Evaluation Window=last 10 iterations, Seeds=52022.04 | 0 | 0 | 0 | 0 | 0 | 0 | 0 |