Offline Reinforcement Learning on Hopper Medium-Expert Noise 2.5
106.17Normalized ReturnCQL
Evaluation Results
| Method | Links | |
|---|---|---|
| CQLModel Category=Model-Free2026.02 | 106.17 | |
| I-TAPModel Category=Model-Based2026.02 | 104.45 | |
| L-MAPModel Category=Model-Based2026.02 | 93.4 | |
| DTModel Category=Model-Free2026.02 | 73.86 | |
| IQLModel Category=Model-Free2026.02 | 60.61 | |
| 1R2RModel Category=Model-Based2026.02 | 52.19 | |
| TAPModel Category=Model-Based2026.02 | 40.86 |