Offline Reinforcement Learning on D4RL Adroit (human, cloned) v0
162.7Adroit v0 Aggregate ScoreMISA
Evaluation Results
| Method | Links | |||||||||
|---|---|---|---|---|---|---|---|---|---|---|
| MISA2022.10 | 162.7 | 88.1 | 8.1 | 5.2 | 0.1 | 58.6 | 2.2 | 0.5 | -0.1 | |
| OneStep RL2022.10 | 142.7 | 71.8 | 1.2 | 5.4 | 1.9 | 60 | 2.1 | 0.4 | -0.1 | |
| IQL2022.10 | 118.1 | 71.5 | 1.4 | 4.3 | 0.1 | 37.3 | 2.1 | 1.6 | -0.2 | |
| TD3+BC2022.10 | 115.7 | 64.8 | 1.8 | 0 | 0.1 | 49 | 0.2 | 0 | -0.2 | |
| BC2022.10 | 104.5 | 63.9 | 1.2 | 2 | 0.1 | 37 | 0.6 | 0 | -0.3 | |
| CQL2022.10 | 93.6 | 37.5 | 4.4 | 9.9 | 0.2 | 39.2 | 2.1 | 0.4 | -0.1 | |
| AWAC2022.10 | 40.9 | 15.6 | 0.1 | 0.1 | 0.1 | 24.7 | 0.3 | 0.1 | -0.1 | |
| DT2022.10 | 0 | — | — | — | — | — | — | — | — | |
| 10%BC2022.10 | -2 | -2 | 0 | 0 | 0 | 0 | 0 | 0 | 0 |