Offline Reinforcement Learning on D4RL MuJoCo & Maze2D v2 (Medium/Replay)
73.2Hopper (Medium) ReturnGAC
Evaluation Results
| Method | Links | |||||||||
|---|---|---|---|---|---|---|---|---|---|---|
| GACReward Type=Final Return, Query Type=p(y^T)2025.12 | 73.2 | 67.5 | 78.9 | 73.3 | 41.5 | 38.8 | 64.2 | 63.3 | 39.5 | |
| GACReward Type=Final Return, Query Type=Exploitation (E[y])2025.12 | 60.2 | 80.1 | 80.2 | 78.9 | 43.6 | 39.8 | 67.8 | 74.5 | 50.3 | |
| LPTReward Type=Final Return2025.12 | 58.5 | 71.2 | 77.8 | 72.3 | 43.1 | 39.6 | 65.4 | 20.6 | 37.2 | |
| DTReward Type=Final Return2025.12 | 57.3 | 50.8 | 69.9 | 51.6 | 42.4 | 33.3 | 28.4 | -2.4 | -2.5 | |
| QDTReward Type=Final Return2025.12 | 50.7 | 38.7 | 63.7 | 29.6 | 42.4 | 32.8 | 2.57 | -2.58 | -2.51 | |
| IQLReward Type=Final Return2025.12 | 35.1 | 13.9 | 49.1 | 5.3 | 8.5 | 5.2 | 4.5 | 3.5 | 2 | |
| CQLReward Type=Final Return2025.12 | 23.3 | 7.7 | 0 | 3.2 | 1 | 7.8 | 3.9 | -3.6 | -1.2 |