Offline Reinforcement Learning on D4RL Mujoco (Locomotion Tasks)
35.4Return (HalfCheetah, Random)CQL
Evaluation Results
| Method | Links | ||||||||||||||||||||
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| CQLsource=original paper2024.05 | 35.4 | — | 10.8 | 7 | 44.4 | 86.6 | 74.5 | 62.4 | 111 | 98.7 | 104.8 | 109.9 | 121.6 | 46.2 | 48.6 | 32.6 | — | — | — | — | |
| EPQ2024.05 | 33 | — | 32.1 | 23 | 67.3 | 101.3 | 87.8 | 95.7 | 108.8 | 112 | 107.2 | 112.4 | 109.8 | 62 | 97.8 | 85.3 | 85.3 | 108.5 | 107.4 | 1,536.7 | |
| MCQ2024.05 | 28.5 | — | 31.8 | 17 | 64.3 | 78.4 | 91 | 87.5 | 111.2 | 114.2 | 96.2 | 111.4 | 107.2 | 56.8 | 101.6 | 91.3 | 82.3 | 108.5 | 95.7 | 1,474.9 | |
| CQLsource=reproduced2024.05 | 20.8 | — | 9.7 | 7.1 | 44 | 58.5 | 72.5 | 91.6 | 105.4 | 108.8 | 96.3 | 110.8 | 110 | 45.5 | 95 | 77.2 | 76.9 | 101 | 93.4 | 1,325.8 | |
| IQL2024.05 | 12.9 | — | 9.6 | 6.9 | 47.4 | 66.3 | 78.3 | 86.7 | 91.5 | 109.6 | 95.4 | 112.4 | 110.1 | 44.2 | 94.7 | 73.9 | 73.3 | 107.2 | 98.1 | 1,318.5 | |
| TD3+BC2024.05 | 12.7 | — | 22.5 | 7.2 | 48.3 | 59.3 | 83.7 | 90.7 | 98 | 110.1 | 98.6 | 111.7 | 110.3 | 44.6 | 60.9 | 81.8 | 75.9 | 81.5 | 95.2 | 1,293 | |
| Onestep2024.05 | 6.9 | — | 7.9 | 6.2 | 48.4 | 59.6 | 81.8 | 93.4 | 103.3 | 113 | 92.3 | 112.3 | 111 | 38.1 | 97.5 | 49.5 | 80 | 107.8 | 102 | 1,311 | |
| MISA2024.05 | 2.5 | — | 9.9 | 9 | 47.4 | 67.1 | 84.1 | 94.7 | 109.8 | 109.4 | 95.9 | 111.9 | 109.3 | 45.6 | 98.6 | 86.2 | 74.8 | 103.5 | 94.8 | 1,354.5 | |
| BC2024.05 | 2.3 | — | 4.1 | 1.7 | 42.6 | 52.9 | 75.3 | 55.2 | 52.5 | 107.5 | 92.9 | 111.2 | 108.5 | 36.6 | 18.1 | 26 | 62.4 | 34.3 | 45 | 929.1 | |
| 10% BCUsage=top 10% of demonstrations2024.05 | 2.2 | — | 4.7 | 2.3 | 42.5 | 56.9 | 75 | 92.9 | 110.9 | 109 | 91.9 | 109.6 | 109.1 | 40.6 | 75.9 | 62.5 | 68.7 | 92.8 | 89.4 | 1,236.9 |