Offline Reinforcement Learning on D4RL Hopper Med-Expert
114.7Normalized Average ReturnWFDiffuser
Evaluation Results
| Method | Links | |
|---|---|---|
| WFDiffuser2025.09 | 114.7 | |
| TTConfiguration=Trifle2023.10 | 113 | |
| DD2023.10 | 111.8 | |
| Decision Diffuser2025.09 | 111.8 | |
| %BC2023.10 | 110.9 | |
| TT2023.10 | 110 | |
| TTConfiguration=base2023.10 | 110 | |
| TT2025.09 | 110 | |
| RGG+planning seeds=152023.10 | 109.9 | |
| RGGplanning seeds=152023.10 | 109.6 | |
| MOREL2023.10 | 108.7 | |
| MOReL2025.09 | 108.7 | |
| DT2023.10 | 107.6 | |
| DTConfiguration=base2023.10 | 107.6 | |
| DT2025.09 | 107.6 | |
| Diffuser2023.10 | 107.2 | |
| CQL2023.10 | 105.4 | |
| CQL2023.10 | 105.4 | |
| CQL2025.09 | 105.4 | |
| TD3(+BC)2023.10 | 98 | |
| IQL2023.10 | 91.5 | |
| IQL2023.10 | 91.5 | |
| IQL2025.09 | 91.5 | |
| TT(+Q)Configuration=Trifle2023.10 | 78.5 | |
| TT(+Q)Configuration=base2023.10 | 74.7 | |
| MBOP2023.10 | 55.1 | |
| BC2023.10 | 52.5 | |
| BC2025.09 | 52.5 | |
| MOPO2023.10 | 23.7 |