Offline Reinforcement Learning on MuJoCo hopper D4RL (medium-replay)
101.6Normalized ReturnMCQ
Evaluation Results
| Method | Links | |
|---|---|---|
| MCQPolicy Type=Gaussian, Seeds=82026.02 | 101.6 | |
| QIPO-OTPolicy Type=Diffusion, Seeds=82026.02 | 101.3 | |
| SRPOPolicy Type=Diffusion, Seeds=82026.02 | 101.2 | |
| QCS-RMethod Category=Ours2024.02 | 100.4 | |
| SPOTPolicy Type=Gaussian, Seeds=82026.02 | 100.2 | |
| SQLMethod Category=Value-Based2024.02 | 99.7 | |
| CACPolicy Type=Diffusion, Seeds=82026.02 | 99.7 | |
| FACPolicy Type=Flow, Seeds=82026.02 | 99.1 | |
| PORMethod Category=Combined Method2024.02 | 98.9 | |
| ACTMethod Category=Combined Method2024.02 | 98.4 | |
| ReBRACPolicy Type=Gaussian, Seeds=82026.02 | 98.1 | |
| EPQPolicy Type=Gaussian, Seeds=82026.02 | 97.8 | |
| CQLMethod Category=Value-Based2024.02 | 95 | |
| CQLPolicy Type=Gaussian, Seeds=82026.02 | 95 | |
| IQLMethod Category=Value-Based2024.02 | 94.7 | |
| IQLPolicy Type=Gaussian, Seeds=82026.02 | 94.7 | |
| DCMethod Category=RCSL2024.02 | 94.2 | |
| CGDTMethod Category=Combined Method2024.02 | 93.4 | |
| IDQLPolicy Type=Diffusion, Seeds=82026.02 | 92.1 | |
| EDTMethod Category=Combined Method2024.02 | 89 | |
| DTMethod Category=RCSL2024.02 | 82.7 | |
| RvS-RMethod Category=RCSL2024.02 | 73.5 | |
| TD3+BCMethod Category=Value-Based2024.02 | 60.9 | |
| TD3+BCPolicy Type=Gaussian, Seeds=82026.02 | 60.9 | |
| QDTMethod Category=Combined Method2024.02 | 52.1 | |
| FQLPolicy Type=Flow, Seeds=82026.02 | 49.8 |