Offline Reinforcement Learning on D4RL Adversarial Corruption medium-replay v2
38.46HalfCheetah Score (Observation)RIQL
Evaluation Results
| Method | Links | |||||||
|---|---|---|---|---|---|---|---|---|
| RIQLBase Algorithm=RIQL, Optimization Strategy=Naïve2025.11 | 38.46 | 19.65 | 41.93 | 19.61 | 49.12 | 60.4 | 38.2 | |
| RIQL+SAMBase Algorithm=RIQL, Optimization Strategy=SAM2025.11 | 35.92 | 18.19 | 50.07 | 21.22 | 65.34 | 49.81 | 40.09 | |
| IQL+SAMBase Algorithm=IQL, Optimization Strategy=SAM2025.11 | 32.42 | 16.72 | 31.86 | 12.61 | 67.22 | 55.34 | 36.03 | |
| IQLBase Algorithm=IQL, Optimization Strategy=Naïve2025.11 | 30.32 | 12.68 | 21.19 | 12.31 | 41.88 | 16.33 | 22.45 |