Offline Reinforcement Learning on D4RL hopper-expert v2
118.9Normalized ScorePhyB
Evaluation Results
| Method | Links | |
|---|---|---|
| PhyBModel category=Model-based2026.05 | 118.9 | |
| CEILProtocol=C-off-LfO, Trials=302023.06 | 113 | |
| Decision Mamba2024.06 | 112.5 | |
| EPQModel category=Model-free2026.05 | 112.4 | |
| TD3+BCModel category=Model-free2026.05 | 112.2 | |
| PMDB2022.10 | 111.7 | |
| PMDBN=10, k=22022.10 | 111.7 | |
| PMDBModel category=Model-based2026.05 | 111.7 | |
| LaMo2024.06 | 111.6 | |
| DemoDICEProtocol=C-off-LfD, Trials=302023.06 | 111.5 | |
| DMGModel category=Model-free2026.05 | 111.5 | |
| SMODICEProtocol=S-off-LfO, Trials=302023.06 | 111.3 | |
| SMODICEProtocol=C-off-LfO, Trials=302023.06 | 111.2 | |
| SMODICEProtocol=C-off-LfD, Trials=302023.06 | 111.1 | |
| SMODICEProtocol=S-off-LfD, Trials=302023.06 | 111 | |
| UWAV2026.02 | 110.5 | |
| PBRL2026.02 | 110.5 | |
| EDAC2022.10 | 110.1 | |
| EDAC2022.10 | 110.1 | |
| DT2024.06 | 109.6 | |
| TD3-BC2026.02 | 107.8 | |
| Uncertainty-Aware Rank-One MIMO Q Network2026.02 | 107.8 | |
| BC2022.10 | 107.7 | |
| BC2022.10 | 107.7 | |
| DemoDICEProtocol=S-off-LfD, Trials=302023.06 | 107.3 | |
| CQL2022.10 | 106.5 | |
| CQL2022.10 | 106.5 | |
| CQLModel category=Model-free2026.05 | 106.5 | |
| IQL2026.02 | 106.2 | |
| CEILProtocol=S-off-LfD, Trials=302023.06 | 106 | |
| CEILProtocol=C-off-LfD, Trials=302023.06 | 105.8 | |
| BCQ2026.02 | 103.6 | |
| CEILProtocol=S-off-LfO, Trials=302023.06 | 103.3 | |
| ADMModel category=Model-based2026.05 | 102.3 | |
| ORIL (TD3+BC)Protocol=S-off-LfD, Trials=302023.06 | 97.5 | |
| OTDFShift Type=Kinematic2025.12 | 97 | |
| CQL2026.02 | 96.5 | |
| BOSAShift Type=Kinematic2025.12 | 94.8 | |
| BC2024.06 | 90.2 | |
| DROCOShift Type=Kinematic2025.12 | 89.3 | |
| MOREL2022.10 | 80.4 | |
| MOReL2022.10 | 80.4 | |
| MOReLModel category=Model-based2026.05 | 80.4 | |
| BRAC2022.10 | 78.1 | |
| BRAC2022.10 | 78.1 | |
| EDAC-102026.02 | 77 | |
| IGDFShift Type=Kinematic2025.12 | 70.1 | |
| ValueDICEProtocol=S-off-LfD, Trials=302023.06 | 65.6 | |
| ORIL (TD3+BC)Protocol=S-off-LfO, Trials=302023.06 | 64.2 | |
| IQLShift Type=Kinematic2025.12 | 62.6 | |
| MOPO2026.02 | 62.5 | |
| DARAShift Type=Kinematic2025.12 | 59.1 | |
| BEAR2026.02 | 54.6 | |
| RAMBO2022.10 | 50 | |
| RAMBOModel category=Model-based2026.05 | 50 | |
| CQLShift Type=Kinematic2025.12 | 47.9 | |
| FQLModel category=Model-free2026.05 | 40.5 | |
| BEAR2022.10 | 39.4 | |
| BEAR2022.10 | 39.4 | |
| IQ-LearnProtocol=S-off-LfD, Trials=302023.06 | 37.3 | |
| IQ-LearnProtocol=C-off-LfD, Trials=302023.06 | 25.9 | |
| SQIL (TD3+BC)Protocol=S-off-LfD, Trials=302023.06 | 25.5 | |
| ORIL (TD3+BC)Protocol=C-off-LfD, Trials=302023.06 | 24.4 | |
| ORIL (TD3+BC)Protocol=C-off-LfO, Trials=302023.06 | 22.5 | |
| ValueDICEProtocol=C-off-LfD, Trials=302023.06 | 18.6 | |
| SQIL (TD3+BC)Protocol=C-off-LfD, Trials=302023.06 | 12.2 |