Offline Reinforcement Learning on D4RL hopper medium v2 (Normalized Score)
109.4Normalized ScorePhyB
Evaluation Results
| Method | Links | |
|---|---|---|
| PhyBModel category=Model-based2026.05 | 109.4 | |
| ADMModel category=Model-based2026.05 | 107.4 | |
| PMDBModel category=Model-based2026.05 | 106.8 | |
| EDAC-102026.02 | 103.6 | |
| EPQModel category=Model-free2026.05 | 101.3 | |
| DMGModel category=Model-free2026.05 | 100.6 | |
| TD3+BCModel category=Model-free2026.05 | 99.5 | |
| DMMModel Category=SSM-based2026.02 | 96.2 | |
| Uncertainty-Aware Rank-One MIMO Q Network2026.02 | 93.2 | |
| DCModel Category=SSM-based2026.02 | 91.2 | |
| RAMBOModel category=Model-based2026.05 | 87 | |
| DMModel Category=SSM-based2026.02 | 86.2 | |
| MOReLModel category=Model-based2026.05 | 84 | |
| PBRL2026.02 | 75.3 | |
| BOSAShift Type=Kinematic2025.12 | 71.4 | |
| EDTModel Category=Transformer-based2026.02 | 70.4 | |
| DTModel Category=Transformer-based2026.02 | 68.4 | |
| QLDTModel Category=Transformer-based2026.02 | 66.5 | |
| IQL2026.02 | 64.1 | |
| CQLModel category=Model-free2026.05 | 61.9 | |
| TD3+BCModel Category=Value-based2026.02 | 59.3 | |
| TD3-BC2026.02 | 59.3 | |
| CQLModel Category=Value-based2026.02 | 58.5 | |
| DROCOShift Type=Kinematic2025.12 | 55.4 | |
| DS4Model Category=SSM-based2026.02 | 54.7 | |
| IGDFShift Type=Kinematic2025.12 | 54.3 | |
| CQL2026.02 | 53 | |
| BCQ2026.02 | 52.5 | |
| BEAR2026.02 | 51.8 | |
| UWAV2026.02 | 50.9 | |
| IQLShift Type=Kinematic2025.12 | 48.8 | |
| DARAShift Type=Kinematic2025.12 | 48.8 | |
| OTDFShift Type=Kinematic2025.12 | 46.3 | |
| FQLModel category=Model-free2026.05 | 44.3 | |
| MOPO2026.02 | 38.3 | |
| CQLShift Type=Kinematic2025.12 | 35.7 |