Offline Reinforcement Learning on D4RL HalfCheetah medium-expert v2
10,364.36Avg True ReturnOptimal Policy
Evaluation Results
| Method | Links | |
|---|---|---|
| Optimal Policy2022.10 | 10,364.36 | |
| SSR-RRSsplits=2, re-trained on full dataset=true2022.10 | 9,681.78 | |
| SSR-RRSsplits=5, re-trained on full dataset=true2022.10 | 9,681.78 | |
| BVFTvariant=pi + FQE, re-trained on full dataset=true2022.10 | 8,799.66 | |
| BVFTvariant=pi x FQE, re-trained on full dataset=true2022.10 | 8,118.84 | |
| CVsplits=2, re-trained on full dataset=true2022.10 | 8,118.84 | |
| CVsplits=5, re-trained on full dataset=true2022.10 | 8,118.84 | |
| PhyBModel category=Model-based2026.05 | 109.4 | |
| PMDBModel category=Model-based2026.05 | 108.5 | |
| ADMModel category=Model-based2026.05 | 103.7 | |
| TD3+BCModel category=Model-free2026.05 | 97.9 | |
| FQLModel category=Model-free2026.05 | 97.5 | |
| EPQModel category=Model-free2026.05 | 95.7 | |
| RAMBOModel category=Model-based2026.05 | 95.4 | |
| CQLModel category=Model-free2026.05 | 95 | |
| DMGModel category=Model-free2026.05 | 91.1 | |
| MOReLModel category=Model-based2026.05 | 80.4 |