Offline Reinforcement Learning on D4RL MuJoCo v0 (Random, Medium-Replay, Medium, Expert Configurations)
35.4HalfCheetah Return (Random)MOPO
Evaluation Results
| Method | Links | ||||||||||||||||
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| MOPO2022.06 | 35.4 | 11.7 | 13.6 | 53.1 | 67.5 | 39 | 42.3 | 28 | 17.8 | 63.3 | 23.7 | 44.6 | — | — | — | — | |
| FisherBRC2022.06 | 32.2 | 11.4 | 0.6 | 43.3 | 35.6 | 42.6 | 41.3 | 99.4 | 79.5 | 96.1 | 90.6 | 103.6 | 106.8 | 112.3 | 79.9 | 974.6 | |
| CQL2022.06 | 21.7 | 10.7 | 2.7 | 41.9 | 28.6 | 15.8 | 37.2 | 44.2 | 57.5 | 27.1 | 111.4 | 68.1 | 82.4 | 111.2 | 103.8 | 764.3 | |
| CABI+IQL2022.06 | 18.4 | 11.4 | 8 | 42.2 | 36.8 | 17.2 | 41.6 | 40 | 55.1 | 96.7 | 112.8 | 104.8 | 104.7 | 112.8 | 106.8 | 909.3 | |
| IQL2022.06 | 16.2 | 9.3 | 6.2 | 40.5 | 33.4 | 15.8 | 41.2 | 30.7 | 50.8 | 89 | 111.5 | 99.7 | 100.8 | 112 | 103.6 | 860.7 | |
| UWAC2022.06 | 2.3 | 9.8 | 3.8 | 38.9 | 18 | 8.4 | 37.4 | 30.3 | 17.4 | 40.6 | 95.4 | 14.8 | 104 | 109.1 | 88.4 | 618.6 | |
| BCQ2022.06 | 2.2 | 10.6 | 4.9 | 38.2 | 33.1 | 15 | 40.7 | 54.5 | 53.1 | 64.7 | 110.9 | 57.5 | 89.9 | 107 | 102.3 | 784.6 | |
| BC2022.06 | 2 | 9.5 | 1.2 | 34.7 | 19.7 | 8.3 | 36.6 | 30 | 11.4 | 67.6 | 89.6 | 12 | 105.2 | 111.5 | 56 | 595.3 |